Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,口型同步覆盖 97 种语言
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成的可视化形象,同步起在 Gemini Enterprise 中开放。
推荐理由:文中说明了异步工具调用与语音对话并行的实现方式,对做企业级语音智能体的读者有直接参考价值。
技术方向
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
5 条精选近 30 天 3 条共收录 7 条
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成的可视化形象,同步起在 Gemini Enterprise 中开放。
推荐理由:文中说明了异步工具调用与语音对话并行的实现方式,对做企业级语音智能体的读者有直接参考价值。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。
推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音智能体带来近实时推理升级。
推荐理由:两个版本的分工和基准分数写得很清楚,读者可以直接据此判断自己的语音场景该选哪一档。
Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。
推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并连续生成流畅自然的译音,保留说话人的语调、节奏和音高,全程只落后说话人几秒。
推荐理由:解释了连续生成与等待上下文之间的取舍,读者可据此理解近实时同传的延迟表现。