谷歌Gemini 3.8 Live虚拟人上线:实时唇形同步+自然表情,无缝切换97种语言

9月24日,谷歌正式宣布推出带有Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。该功能将低延迟视频生成与语音相结合,打造能倾听、观察并以动态视觉形象交流的企业级交互体验,目前已在Gemini Enterprise上线。

9月24日,谷歌正式宣布推出带有Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。该功能将低延迟视频生成与语音相结合,打造能倾听、观察并以动态视觉形象交流的企业级交互体验,目前已在Gemini Enterprise上线。

对话天生多模态:企业智能体的“一张脸”

谷歌在官方博客中表示:“对话本身就是多模态的:我们倾听、观察、说话,并使用面部表情来沟通。”Live Avatar将语音、视觉和面部表情统一到企业智能体中,通过精准唇形同步、自然表情和流畅的对话轮次切换,让数字交互变得更加丰富和自然。

Live Avatar同时处理视觉和音频输入,生成更丰富的对话体验。其核心应用场景包括客户服务和交互式导览,旨在让AI智能体从“只有声音”升级为“有面孔、有表情的对话伙伴”。

异步工具调用:说话与干活并行

除视觉呈现外,Live Avatar依托Gemini的高级推理能力,支持异步工具调用。这意味着模型可以在后台触发工具调用并获取数据,同时保持对话正常进行,在处理复杂任务时不会让用户经历“沉默的等待”。

谷歌举例说明:你可以让Live Avatar帮你办理酒店入住,同时继续与它讨论其他事项——它在后台查询预订系统的同时,对话不会中断。

97种语言无缝切换:唇形与表情同步适配

Live Avatar支持原生多语言语音对语音同步,能够动态适配唇形同步和表情,在97种语言之间无缝切换,且不会降低视频保真度或出现视觉偏移。这意味着当语言在对话中途切换时,唇形和面部动画必须实时跟上,保持视觉一致性。

预设与自定义:品牌形象的两级方案

企业可以从多样化的预设头像库中选择合适的形象,也可以通过一张高质量参考图像生成自定义虚拟形象,同时保留参考对象的相似度、品牌风格或角色特征。

不过,自定义虚拟形象生成目前仅对企业白名单用户开放,需要联系谷歌销售代表进行申请和资源配置。

SynthID水印:透明与安全并重

所有Live Avatar生成的音频和视频输出都嵌入了SynthID隐形水印,直接织入音视频轨道,帮助识别AI生成内容,减少错误信息和错误归属问题。这一安全设计体现了谷歌对身份尊重和内容透明度的重视。

竞争格局:AI虚拟人赛道升温

谷歌进入AI虚拟人市场,直接与HeyGen、Synthesia等专业平台竞争。HeyGen的LiveAvatar平台同样提供实时AI头像技术,支持FULL模式和LITE模式,从2分钟视频即可训练自定义头像,定价约$0.18/分钟。Synthesia则以企业培训视频见长,估值达40亿美元。

与这些“异步”工具不同,Live Avatar是为实时交互而构建的,这是一个更难的工程问题,也是一个不同的市场。

Live Avatar的意义不在于“AI有了脸”,而在于异步工具调用这一架构创新——它让AI在对话的同时“干活”,将交互从“请求-响应”升级为“持续陪伴”。当AI能够一边和你聊天一边在后台办理入住、查询数据时,企业智能体的价值边界被显著拓宽。97种语言的实时唇形同步则为跨国企业提供了统一的视觉服务界面,大幅降低多语言部署的本地化成本。

谷歌Gemini 3.8 Live虚拟人上线:实时唇形同步+自然表情,无缝切换97种语言 | AIYXL