谷歌云旗下 Gemini 3.8 Live with Live Avatar 功能正式面向企业用户全面开放,将实时视频虚拟形象与多语言语音对话能力整合为一体,标志着企业级对话式 AI 从纯语音交互向多模态视觉交互迈进。
该功能于本周正式在 Gemini Enterprise 中上线,此前已在 Google Cloud Next 2026 上完成预览展示。
新版本支持视频虚拟形象的实时唇形同步、97 种语言自动识别与切换,以及后台工具调用与 API 执行,同时提供美国和欧盟双区域端点部署,满足企业合规与数据治理要求。
从客户落地情况来看,Cox Automotive 已将该技术应用于旗下 Autotrader 平台,构建了可实时高亮屏幕内容、引导消费者完成车辆搜索与融资流程的购车 AI 助手;印度 AI 公司 Equal AI 则表示,基于 Gemini 3.8 Live,其平台目前每日处理超过百万次实时通话,覆盖九种印度语言。
这是谷歌本周第二次发布新的人工智能模型。周三,谷歌宣布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型。
周四截至发稿,谷歌盘中上涨 0.66%。

核心功能:多模态融合,超越语音基础能力
Gemini 3.8 Live with Live Avatar 在原有语音基础上引入视觉交互层,主要面向网页端、移动端及实体交互终端(interactive kiosks)等多种部署场景。
在对话连贯性方面,该模型采用原生语音到语音(speech-to-speech)架构,支持自然打断恢复,且不会丢失对话上下文或中断后台事务处理。
工具调用能力方面,模型可在持续对话的同时,在后台异步执行工具调用与 API 请求,让交互体验更为流畅,不因后台任务而产生明显停顿。
视觉理解方面,Live Avatar 支持实时摄像头画面与屏幕共享的同步处理,可与音频输入并行分析,为服务场景提供更丰富的上下文感知能力。
语言覆盖上,97 种语言支持及自动检测功能,使其具备面向全球多语言市场的规模化部署潜力。
信任机制:水印技术与身份管控并行
针对深度伪造及身份滥用风险,谷歌在该功能的合规设计上采取了双层管控策略。
在虚拟形象使用层面,企业用户可从谷歌提供的预建虚拟形象库中进行部署;而自定义虚拟形象功能则设有严格的企业白名单与身份核验机制,
目前仅限申请通过的企业使用。在内容溯源层面,所有生成的音频与视频流均嵌入谷歌 SynthID 不可感知水印,以确保 AI 生成内容在传播过程中保持可识别性与可验证性。
这一机制的引入,一定程度上回应了企业部署对话式 AI 时面临的监管合规压力,尤其是在金融服务、医疗及客户服务等强监管行业。
客户落地:从购车助手到百万级通话场景
目前已有多家企业披露基于 Gemini 3.8 Live 的应用进展,涵盖汽车电商、电信客服及 CRM 等多个垂直领域。
Cox Automotive 首席产品官 Marianne Johnson 表示,Autotrader 的对话式 AI 虚拟形象将自然语言描述与库存匹配相结合,是其 " 连接智能 " 愿景落地的重要步骤,该愿景旨在让每次消费者互动均能调用 Cox Automotive 的完整数据资产。
Equal AI 首席执行官 Akhilesh Damaraju 称,借助 Gemini 3.8 Live 在打断处理、多语言对话及工具调用稳定性方面的改进,该平台现已实现每日超百万次实时通话处理,覆盖九种印度语言,目标是构建 " 了解你、说你的语言、始终站在你这边 " 的个人 AI。
Salesforce Agentforce 产品副总裁 Bob Van Osten 表示,Salesforce AI Research 与谷歌的合作旨在探索实时多模态能力与代理式 AI 的结合,以打造从首次接触到问题解决全流程的客户服务体验。


登录后才可以发布评论哦
打开小程序可以发布评论哦