AI Pulse

谷歌新模型对话不中断,一句“让我查一下”后台继续干活

谷歌新模型对话不中断,一句“让我查一下”后台继续干活

谷歌发布了两款实时对话模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking。官方称这是迄今最先进的实时对话模型。3.8 Live 面向规模化和成本效率,适合大批量部署。它结合了对话智能、流畅对话和视觉理解。Extended Thinking 面向高复杂度任务,智能更强,多步推理更扎实。

后台干活,对话不断

两个模型最直观的变化是交互节奏。3.8 Live 可以在后台执行工具和 API 调用,同时保持对话。交代任务后,模型先口头确认,后台继续干活,对话不中断。

Extended Thinking 更进一步,推理和说话同时进行。处理多步骤任务时,它会先来一句“让我查一下”。然后通过实时进度叙述,带用户走完整段流程。这些口头语让对话在思考间隙保持连贯,不会长时间沉默下来。

除了声音,模型还能看。3.8 Live 近实时处理视觉输入,画面信息会融入对话上下文。语言切换也是自动的。97 种支持的语言可以在对话中途检测并切换,不用手动设置。

评测数字说了什么

第三方评测里,Extended Thinking 在 Artificial Analysis 的语音到语音质量指数上排名第一,得分 82.6。它在 τ-Voice 基准的实操任务完成率上达到 68.6%。在 Sierra 的 τ-Voice-banking 基准上,完成率是 35.1%。它还在 Big Bench Audio 拿到 97.7% 的高分。价格与前沿模型相比有竞争力,具体金额没有公布。3.8 Live 则在 Speech Agent Arena 的用户偏好评测中排名第二。在 ServiceNow 的 EVA-Bench 上,模型在复杂工作流里同时提升了准确性和对话质量。不是靠牺牲一个换另一个。

今天起分批落地

两个模型的推出渠道已经明确,3.8 Live 从发布当天起开放。开发者从 Gemini API 和 Google AI Studio 接入。企业可以在 Gemini Enterprise 的私有预览中试用。普通用户在 Search Live 里用到它。遇到问题时,直接说话,就能拿到逐步的实时排查指导。在 Search Live,搜索从给链接变成给步骤。

Extended Thinking 也在同一天上线,开发者同样走 Gemini API 和 Google AI Studio。企业端先在 Gemini Enterprise 私有预览里提供。面向客户体验和 Workspace 商业客户的版本即将推出。普通用户可以在 Gemini Live 里用,Google AI Pro 和 Ultra 订阅者的 Workspace Docs 也能用。所有 Google AI 订阅者的 Gmail 和 Keep 也已接入。谷歌称,Live 模型在 Workspace 和 Search 中会带来更直观、协作的体验。

平台、合作方与水印

配套已经就位。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents——这些开发者平台都接入了 Gemini Live API。借助这些平台,开发者能快速构建和部署语音界面。Salesforce、Genspark、Lumeris 等公司也参与了合作。它们对模型的延迟、流畅性和工具调用能力表示认可。

安全方面,所有 AI 产品生成的音频都带 SynthID 水印。这个水印直接织进音频输出,人耳听不出来。检测方可以借此确认音频是不是 AI 生成,防止 AI 语音被拿去造假。

谷歌没有说明这两个模型什么时候进入 Google Assistant 或 Android。那才是语音助手覆盖面最大的入口。定价、中文环境下的实际表现、语音数据的处理和存储方式,都还没有细节。技术已经到位,落地和隐私边界是下一关。

阅读原文
📚 相关主题 产品发布Google

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新