谷歌为Gemini 3.8 Live加入数字人形象

IT时代网9月25日消息,谷歌宣布在Gemini 3.8 Live中引入Live Avatar,把原生实时对话能力与低延迟视频流结合起来,让对话式AI具备接近实时的可视化形象。

按照官方说明,该功能把语音与接近实时的视频生成配对,形成一个会听、会看、会说并带有动态视觉形象的交互体验。唇形同步、表情自然度与对话轮次切换是这次强调的三点,企业可以借此把虚拟服务做得更具交互性,无论是客户服务还是操作引导。

Live Avatar即日起在Gemini Enterprise中提供。它同时处理视觉与音频输入,把对话从单一通道扩展成多模态。

除了视觉呈现,背后的推理能力仍由Gemini承担。异步工具调用让Live Avatar在后台触发工具、抓取数据的同时继续对话,处理复杂任务时对话流不会中断。

语言方面,它具备原生的多语言语音到语音同步能力,口型与表情会随语言动态调整,可在97种语言之间切换,视频保真度不受影响,也不会出现画面漂移。

形象可以定制。除了一批预设头像,企业还能从一张高质量参考图出发生成完整可动的形象,保留参考对象的相似度、品牌风格或角色设定。目前自定义头像仅通过企业白名单开放。

官方表示,所有AI产品输出都会带上SynthID水印,水印被直接织入音频与视频,用于标示内容由AI生成。

编辑:林一舟

THE END