Google Gemini 3.8 Live 是谷歌在 9 月 15 日发布的实时语音对话模型,也是 Gemini 家族迄今最强的「耳朵和嘴巴」。它一口气推出两个版本:主打规模化与成本效率的 3.8 Live,以及面向高复杂度任务的 3.8 Live Extended Thinking。对于正在做语音助手、客服机器人、语音 Agent 的团队来说,这可能是今年最值得关注的音频模型更新。
核心能力
Gemini 3.8 Live 的核心不是「能说话」,而是「边想边说、边说边做」。它在实时对话中引入了几项关键升级:
- 近实时推理:Extended Thinking 版能做到「边推理边说话」,用「让我查一下」这类口头过渡语自然衔接,同时后台并行处理多步骤任务。
- 视觉理解:实时处理视觉输入,可以看着棋盘下棋、看着员工入职流程即时答疑。
- 97 种语言切换:对话中自动检测并在语言间无缝切换,无需手动指定。
- 后台工具调用:一边继续聊天,一边在后台执行 API 调用、协调餐厅订位等任务,不打断对话流。
- SynthID 水印:所有生成音频都嵌入隐形水印,防止 AI 音频被滥用。
在基准测试上,Extended Thinking 版本登顶 Artificial Analysis 的语音转语音质量指数(82.6 分,全榜第一),在 τ-Voice 智能体任务完成率上拿到 68.6%,Big Bench Audio 达 97.7%。3.8 Live 则在 Speech Agent Arena 中拿到第二,同时保持极低的推理成本,适合大规模部署。
使用体验 / 局限
对开发者而言,入口很清晰:Gemini API 和 Google AI Studio 当天即可调用,Agora、LiveKit、Pipecat、Vercel 等平台也第一时间提供了集成,无需自己搞定实时音视频流基础设施。普通用户则可以在 Search Live 里直接体验,企业侧目前是 Gemini Enterprise 的私有预览。
局限同样明显:一是它本质是「音频/语音」模型,文字写作、代码生成等非语音场景仍是 Gemini 3.8 Flash 或 Pro 的主场;二是 Extended Thinking 的企业版本仍在预览阶段,生产级商用还需再等等;三是实时语音对网络延迟敏感,弱网环境下的体验会打折扣。
综合评分
| 维度 | 评分 | 评价 |
|---|---|---|
| 功能完整度 | 8.5 / 10 | 语音+视觉+工具调用+多语言齐全,但非语音场景非其所长 |
| 易用性 | 8.5 / 10 | API 即开即用,主流平台已集成 |
| 性价比 | 8.0 / 10 | 官方强调成本竞争力,但具体定价需按量评估 |
| 中文支持 | 8.0 / 10 | 97 语言自动切换,中文流畅度待实测 |
| 输出质量 | 8.8 / 10 | 语音质量指数全榜第一,对话自然度高 |
综合评分:8.4 / 10
如果你正在做语音客服、实时翻译或语音 Agent,Gemini 3.8 Live 是当前综合实力最均衡的选择之一。想了解它和更多 AI 工具的真实表现,欢迎到 AI Dash 看更多深度评测。

Pingback: Google 给 Gemini 装上一张脸:Live Avatar 实时唇形同步,97 种语言视频对话 – AI Dash
Pingback: OpenAI、Anthropic、Google 联手成立 SAFA:AI 安全标准要自己定了 – AI Dash
Pingback: Google Gemini 在印度测试电商购物:AI 智能体从帮你搜进化到帮你下单 – AI Dash
Pingback: ChatGPT 上线虚拟试衣:上传自拍看衣服上身效果,还能收藏心仪好物 – AI Dash