跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

5 条精选近 30 天 3 条共收录 7 条

更新

语音与音频的精选

9月25日周五第 1–5 条
9月23日周三
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。

    推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。

9月16日周三
8月27日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。

    推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。

6月9日周二