跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

3 条精选近 30 天 3 条共收录 6 条

更新

语音与音频的精选

9月25日周五第 1–3 条
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时音视频能力、异步工具调用与 97 种语言支持,可据此判断企业级对话智能体的形态变化。

9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 的定位差异、语音克隆与逐行导演能力,以及多项基准排名,便于判断其在配音与语音智能体场景的适用性。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:官方给出两款语音模型在语音质量与智能体任务基准上的排名和分数,可据此判断实时语音智能体的能力水位。