Gemini 3.8 Live让企业AI客服长出一张实时生成的脸
一张实时生成的脸
上周,Google 发布了 Gemini 3.8 Live。Live Avatar 是它新加的能力,从今天起在 Gemini Enterprise 里可用。对话式 AI 在语音之外多出一个实时视频生成的虚拟形象。它能听、能看、能说,唇形同步精确,表情自然,轮流对话流畅。
这个功能同时处理视觉和音频输入,两路信息在同一时间轴上前进,对话因此更丰富。它不只有一副面孔,支持多种角色,每个角色有独立的外观、声音和表现力。
对话不打断,事在后台办
Google 把它放在企业场景里,列出的用途是客户服务和交互式演示。官方示例是酒店办理入住:AI 一边和客人聊天,一边在后台调用工具办手续。对话不打断。
等待的过程被移到了看不见的地方。
97 种语言之间切换
语言能力是另一个卖点。Live Avatar 支持原生多语言语音到语音同步。97 种语言之间可以无缝切换,切换时唇形同步和表情会动态调整。视频保真度不降,画面和声音也不会脱节。对跨国业务来说,同一套数字员工可以覆盖多个语言市场。
定制需走白名单
企业可以从预设头像库里选,也可以自定义虚拟形象,让线上员工贴合品牌形象。自定义创建目前只向企业白名单开放。Google 没有说明申请流程和条件。现有客服系统接入这套数字员工需要多少开发量,目前也不清楚。
水印和开发接口
Live Avatar 生成的音频和视频,都会嵌入 SynthID 水印。这个看不见的水印织进输出里。AI 生成内容因此保持可检测,错误归因和虚假信息也能减少。开发者可以从 API 文档开始接入。
实时表情和语音同步被放进同一个虚拟形象。企业数字员工的边界,从文字和语音延伸到了脸。中文的唇形同步效果如何,这套系统卖多少钱,Google 都没有说。