Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音模型
Google DeepMind 为 Gemini 家族新增两款文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS。
推荐理由:原文详细说明了两个新语音模型的核心能力、适用场景和开放入口,读者可以据此评估它们对音频创作和产品集成的影响。
技术方向
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
2 条精选近 30 天 2 条共收录 4 条
Google DeepMind 为 Gemini 家族新增两款文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS。
推荐理由:原文详细说明了两个新语音模型的核心能力、适用场景和开放入口,读者可以据此评估它们对音频创作和产品集成的影响。
Google DeepMind 发布两款专为实时对话优化的新模型 Gemini 3.8 Live 和 3.8 Live Extended Thinking。Gemini 3.8 Live 注重规模化与成本效益,支持 97 种语言实时切换和后台工具调用。
推荐理由:原文给出了两个新模型的核心定位、关键能力差异和开放入口,读者可以据此判断它们会怎样改变语音交互和复杂任务处理。