跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

2 条精选近 30 天 2 条共收录 4 条

更新

语音与音频的精选

9月23日周三第 1–2 条
9月16日周三
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind 发布两款专为实时对话优化的新模型 Gemini 3.8 Live 和 3.8 Live Extended Thinking。Gemini 3.8 Live 注重规模化与成本效益,支持 97 种语言实时切换和后台工具调用。

    推荐理由:原文给出了两个新模型的核心定位、关键能力差异和开放入口,读者可以据此判断它们会怎样改变语音交互和复杂任务处理。