谷歌发布两款实时对话模型
昨晚,谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,并表示这是其迄今为止最先进的实时对话模型。两款模型在智能和并行推理方面进行了重大升级,让用户能够更直观地使用语音进行协作并执行复杂任务。
两款模型虽然都面向语音 Agent,但分工不同:Gemini 3.8 Live 侧重低延迟和规模化部署,Extended Thinking 则为需要多步骤推理、调用多个工具的复杂任务增加了后台思考能力。
据介绍,这两款模型已通过 Gemini API 和 Google AI Studio 向开发者开放。
那么,谷歌新发的这两款语音模型,要解决什么问题?
据谷歌方面称,此次更新要解决一个语音 Agent 常见的问题:用户要求助手查数据、调用系统或完成预约时,对话往往会停下来,等待工具返回结果。文字界面可以显示“正在处理”,但语音通话中的几秒沉默会让人难以判断它究竟在思考、执行任务,还是已经失去响应。
谷歌在 Live API 技术文档中解释,Gemini 3.8 Live Extended Thinking 可以在后台规划任务并异步调用工具,同时先给出“我来查一下”之类的语音回应。任务继续执行时,模型还能口头报告进度,最后再说出结果。例如,用户要求比较航班与酒店,Agent 可以分别查询相关服务,查询过程中维持对话,而不是等所有接口返回后才第一次开口。
这也改变了开发者判断“一轮对话结束”的方式。
普通实时语音模型说完一段话,通常就意味着该轮响应结束;Extended Thinking 可能已经说完一句进度提示,却仍在后台推理或等待工具结果。因此,开发者需要根据 Live API 返回的 IN_PROGRESS 和 IDLE 状态判断任务是否真正完成。
技术文档还规定,Extended Thinking 的工具调用必须采用非阻塞方式,并允许开发者将思考深度设为低、中、高三个等级。
Gemini 3.8 Live 也支持异步工具调用,但谷歌将它定位为多数低延迟语音应用的默认选择。
Extended Thinking 面向跨多个接口检索信息、分析日志排障、验证公式或辅导代码等任务。两款模型的区别并非简单的“普通版与加强版”:在真实应用中,响应速度、任务复杂度,以及客户端能否正确处理后台执行状态,都会影响选择。
此外,这两款模型的特别之处还在于,它们不只是听语音,还要理解眼前的画面。
这也是谷歌此次强调的另一项能力——视觉输入。Gemini 3.8 Live 可以在近乎实时的对话中处理用户展示的画面,再结合语音问题作答。
Gemini 3.8 Live 实时指导员工入职,利用可视化上下文回答实时问题。
官方还演示了该模型一边观察棋盘、一边与用户交流棋局的能力。模型支持在对话中识别并切换 97 种语言。

观看 Gemini 3.8 Live 近乎实时地使用视觉上下文、推理和自然对话流程进行国际象棋对弈。
开发者博客还列出几项面向业务应用的能力:识别确认码、保险理赔编号等字母数字混合信息;将实时音频与结构化数据结合,以更新回答所依据的上下文;以及在持续输出语音时执行 API 调用。对于电话客服、现场支持等场景,模型既要听懂用户的问题,也要准确读取编号、理解现场画面,并与企业系统交互,这些环节都会影响任务能否完成。
不过,实时视觉输入也意味着开发者需要管理输入量。谷歌提示,视频帧默认会发送给模型,应按需要提供画面,以控制上下文占用和费用。两款模型均支持文字、图像、音频和视频输入,模型页面列出的输入上限为 131072 Token。它们支持函数调用,但模型文档并未将代码执行、文件搜索或结构化输出列为支持能力。
跑分第一,具体赢在哪?
根据评测机构 Artificial Analysis 的语音到语音榜单,Gemini 3.8 Live Extended Thinking 的 High 配置取得 82.6 分综合指数。这一指数汇总了语音推理、Agent 任务表现、用户偏好和任务成功率;82.6 是指数分数,并非“82.6 百分位”。

在具体项目上,该模型于 τ-Voice Agent 任务测试中取得 68.6%,在 Big Bench Audio 语音推理测试中取得 97.7%。


谷歌披露,它在 Sierra 的 τ-Voice-banking 银行业务任务测试中取得 35.1%。基础版 Gemini 3.8 Live 则在 Artificial Analysis 的 Speech Agent Arena 用户偏好榜中排名第二。


这些数据说明语音模型的竞争已不只是“说得自然”。Big Bench Audio 检验模型能否理解并回答以音频提出的推理问题;τ-Voice 关注语音 Agent 执行任务的能力;用户偏好测试则衡量实际交谈后的体验。
它们从不同角度评价模型,但值得注意的是,单项成绩不能直接推算企业部署后的完成率。开发者仍需结合自己的工具、数据和真实对话流程进行测试。
成本也是语音 Agent 落地时必须计算的一笔账。谷歌将两款 3.8 Live 模型列在同一标准价格项下:付费档音频输入标价约 0.005 美元 / 分钟,音频输出约 0.018 美元 / 分钟;文字以及图像、视频输入另有计费项目。持续收听、生成语音和处理画面的实际用量,都会影响最终费用。
这次发布呈现出谷歌对语音 Agent 的判断:自然对话是入口,真正困难的是在对话不断线的情况下理解现场、调用外部系统并完成任务。Extended Thinking 将推理和执行过程搬到后台,让用户听到进度;它的实际价值,还要看开发者能否把这种能力接入可靠的业务流程。
谷歌究竟是“落后了”,还是走了另一条路?
谷歌强调两款新模型能够边对话边推理、在后台调用工具,模型发布后在多个社交平台引发热议。
在 x 上,网友 Mike Kipruto 表示,自己准备实际测试,最想知道的是模型“能否在后台运行任务的同时进行推理、使用工具,并让对话继续进行”。他的关注点落在这次发布的核心能力上:语音 Agent 开始执行任务后,是否真的还能自然地与人交流。
也有用户认为,持续推出新模型尚未回答他们对模型质量的期待。
KUMAR 留言,希望谷歌在未来的 Gemini 4 或 4 Pro 中减少设计内容里的“AI 味”以及模型幻觉。Francesca A 的批评更尖锐:在她看来,用户需要的是一款能够与 Claude、OpenAI 模型乃至 Kimi 3 相比的 Pro 或前沿模型;她认为谷歌上一次推出有突破性的前沿模型还是 Gemini 2.5 Pro。

模型可用性同样引发讨论。Pear 表示称,自己使用的 Gemini 3.8 Flash High 在过去两天“无法正常工作”。另一名用户 TLM13 抱怨,最近三次使用 Google Studio 时,系统反复尝试修复问题,直到用完使用额度仍未解决。


在 Reddit 平台,更多的讨论集中在一个更大的问题上:谷歌接连推出 Flash、Live 等模型,为什么没有发布网友期待的新版 Pro 模型?
用户 technopixel12345 将猜测说得很直接:“他们要么藏着一个强大的 Pro 模型,要么就是远远落后了。”另一名用户追问谷歌:“什么都发布,就是不发布另一个 Pro 模型,是吗?”


但也有人认为,只盯着前沿模型榜单,会误读谷歌的产品策略。
用户 bysse 判断,谷歌最终可能“胜出”,理由是它拥有全球基础设施,而 Gemini 本身具备多模态能力、价格较低,用途也不限于编码。

willitexplode 的观点更具体:谷歌面向普通用户需要的是“快速、准确的智能”,未必需要把最强的模型都作为公开产品提供。
还有网友把讨论拉回新模型的演示效果。Hans-Wermhatt 对员工入职指导演示中,语音助手主动描述用户当前页面的行为感到不满:“我知道自己在哪一页。除非我提问,或者我有视觉障碍,否则你不用告诉我正在看什么。”他认为,模型在其他演示中也倾向于重复描述眼前画面。这个批评指出了实时视觉助手的一个体验问题:模型能够看见画面,只是能力的起点;它还需要判断何时该说、何时该保持安静。
Reddit 上的分歧因此没有停留在“谷歌是不是榜单第一”。一部分网友催促更强的 Pro 模型,另一部分认为低成本、多模态和产品覆盖同样重要。对于此次发布的语音 Agent,用户最终要检验的仍是它能否在实际任务中准确理解现场、恰当地开口,并把后台工作做完。
参考链接:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
https://artificialanalysis.ai/speech-to-speech
文章来自于微信公众号 “InfoQ”,作者 “InfoQ”