返回深度
模型产品发布2026-09-25 07:02:376 min readAione Editorial V4

谷歌Gemini 3.8 Live上线实时数字人推动企业多模态交互升级

谷歌已发布Gemini 3.8 Live并推出LiveAvatar实时数字人功能,支持97种语言与唇形同步,企业可用于客服、导购等场景,将推动对话AI从纯语音向视觉交互升级。

Aː
Aione AI 编辑部
Research · Writing · Review · Publishing
2026-09-25 07:02:37 6 分钟

发布概况

谷歌于2026年9月24日发布Gemini 3.8 Live,正式推出LiveAvatar实时数字人功能,目前已面向企业用户开放[S1]。该功能于本周在Gemini Enterprise中上线,此前已在Google Cloud Next 2026上完成预览展示[S4]。

与传统数字人产品不同,LiveAvatar并非独立的视频生成工具,而是深度整合在Gemini 3.8 Live实时对话体系内的多模态交互层,企业用户可以在现有对话式AI应用的基础上直接叠加虚拟形象能力,无需额外对接独立的数字人生成服务。

为满足不同地区企业的合规需求,谷歌同步提供美国和欧盟双区域端点部署,企业可根据数据驻留要求选择对应的服务区域[S4]。这一设计针对金融、医疗、跨境客服等强监管场景做了适配,降低了企业引入视觉化对话AI的合规门槛。

核心能力

LiveAvatar功能整合了实时视频虚拟形象与多语言语音对话,支持唇形同步和97种语言识别与切换[S1]。在对话过程中,虚拟形象的口型会随语音内容实时变化,同时配合自然的面部表情变化,减少纯语音交互带来的疏离感。

底层架构上,该功能采用原生语音到语音(speech-to-speech)架构,支持自然打断恢复,用户中途插话时不会丢失对话上下文,也不会中断后台正在执行的事务处理[S7]。这一特性对客服、导购等高频打断场景尤为重要,避免了传统语音助手被打断后需要重新复述需求的问题。

工具调用方面,模型可在持续对话的同时,在后台异步执行工具调用与API请求,对话过程不会因后台任务产生明显停顿[S7]。例如在购车咨询场景中,AI可以一边回答用户问题,一边在后台查询库存、计算分期方案,结果准备完成后再自然插入对话,而不会让用户长时间等待。

视觉理解层面,Live Avatar支持实时摄像头画面与屏幕共享的同步处理,可与音频输入并行分析[S7]。这意味着虚拟形象不仅能说话,还能看到用户展示的实物、文档或屏幕内容,并基于视觉信息给出更精准的回应,适用于远程技术支持、产品演示等场景。

合规与安全

针对深度伪造及身份滥用风险,谷歌采取了双层管控策略。企业用户可直接使用谷歌提供的预建虚拟形象库快速部署;自定义虚拟形象功能则设有严格的企业白名单与身份核验机制,目前仅限申请通过的企业使用[S4]。

在内容溯源层面,所有生成的音频与视频流均嵌入谷歌SynthID不可感知水印,确保AI生成内容在传播过程中保持可识别性与可验证性[S4]。水印不会影响观看和收听体验,但可以通过对应的检测工具识别内容的AI生成属性,帮助企业和平台应对虚假内容传播风险。

这种“准入管控+内容水印”的双重机制,一定程度上回应了企业部署对话式AI时面临的监管合规压力。尤其是在金融服务、医疗健康及公共服务等领域,AI生成内容的可追溯性已经成为企业采购的重要评估指标。

落地进展

目前已有多家企业披露基于Gemini 3.8 Live的应用进展,覆盖汽车电商、电信客服及多语言服务等多个垂直领域。

Cox Automotive已将该技术应用于旗下Autotrader平台,构建了可实时高亮屏幕内容、引导消费者完成车辆搜索与融资流程的购车AI助手[S4]。用户在浏览车辆信息时,虚拟形象可以同步指向屏幕上的配置参数、价格明细等内容,帮助用户更快理解复杂的购车方案。

印度AI公司EqualAI基于Gemini 3.8 Live,其平台目前每日处理超过百万次实时通话,覆盖九种印度语言[S4]。多语言支持和稳定的打断处理能力,是该公司选择Gemini 3.8 Live的核心原因,这也印证了实时对话AI在新兴市场的规模化应用潜力。

值得注意的是,这是谷歌本周第二次发布新的人工智能模型。此前,谷歌宣布推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型[S6]。连续的产品更新显示出谷歌在实时语音与多模态交互领域的加速布局,也反映出企业级AI市场对低成本、高自然度交互方案的旺盛需求。

行业影响

Gemini 3.8 Live with Live Avatar的推出,标志着企业级对话式AI正在从纯语音交互向多模态视觉交互阶段迈进。过去几年,语音助手和聊天机器人已经在客服、营销等场景得到广泛应用,但纯文本或纯语音的交互形式在信息传递效率、用户信任感等方面仍存在局限。

实时数字人功能的加入,使得AI助手具备了可视化的交互界面,能够通过表情、动作、屏幕指引等方式传递更多信息,尤其适合产品讲解、操作指导、情感陪伴等需要更强信任感和沉浸感的场景。

从技术趋势来看,多模态实时交互正在成为头部AI厂商竞争的新焦点。相比单纯提升文本推理能力,将语音、视觉、动作生成等能力整合到统一的实时对话体系中,更能直接拉动企业端的应用价值和付费意愿。

目前该功能仍处于企业专属阶段,普通个人用户的开放时间表尚未公布。自定义虚拟形象的申请条件、审核标准和具体收费模式也未完全披露。后续随着功能的逐步普及和成本下降,实时数字人对话有望从高端企业场景逐步下沉到更广泛的消费级应用中。

Editorial dossier

制作记录

公开编辑轨迹,不含隐藏推理。

制作记录已完成审读
材料已核验公开资料经过整理
多方来源互证保留可追溯引用
文字完成审读编辑意见已被处理
制作记录文章已进入公开阅读

正在整理制作记录…

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-09-25 07:02:37。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。