虎牙WAIC 2026首发实时多模态数字人VAM 1.0

红星新闻 2026-07-19 13:55

7月18日,2026世界人工智能大会(WAIC)腾讯AI 应用创新论坛在上海成功举办。虎牙公司董事长林松涛出席论坛并致辞,他表示,真实场景是AI价值的第一现场,终端是AI普及的最后一公里。当前模型能力的差距在收窄,但工程化的差距在拉开;AI普惠的标志不是最强的人变得更强,而是普通人用AI不再普通。随后,虎牙公司CEO黄俊洪的演讲则为这一理念提供了来自游戏娱乐场景的具体注脚,虎牙自研的实时多模态数字人VAM1.0,正是在一个真实的、7×24小时运转的场景中生长出来的AI应用。

微信图片_20260718150500_920_46.jpg

虎牙公司董事长 林松涛

沙利文最新报告数据显示,中国数字人赛道年复合增长率达52%,约为全球增速的1.5倍至2倍,亚太是最大的增量市场。但市场很热,落地很冷,多数数字人仍停留在照着脚本念的阶段,能说不能听,能输出不能互动。一段三分钟视频没问题,一场三小时直播撑不住。黄俊洪认为,数字人从展示型产品走向实时交互型应用,需要同时解决稳态、拟态和动态三类问题,即长时间生成不崩、表情动作足够自然,以及能够实时聆听、实时反馈、实时互动。

此次亮相的VAM1.0,正是虎牙围绕上述行业痛点打造的最新技术成果。作为基于DiT架构的实时多模态数字人基础模型,黄俊洪一句话概括其能力:“给它一张静态照片,它还你一个能实时说话、实时聆听、实时反应的虚拟人。不是预渲染,不是录播,是每一帧都在线生成。”VAM采用三段式训练体系,一阶让它稳,通过多参考帧加运动帧锚定形象;二阶让它真,利用偏好优化算法在多目标间找到平衡;三阶让它快,推理步骤大幅压缩并引入自纠错机制。“总结来说,就是让它不崩,让它好看,让它省钱”,黄俊洪表示。性能方面,在同等推理集群下,VAM达到36.4帧每秒、首帧1.3秒,与八个主流模型对比,推理最快、延迟最低,四项核心指标全面领先且算力开销更低。

黄俊洪特别强调了VAM的交互特性,原生覆盖静默、聆听、说话三种状态。用户说话时数字人点头注视,停下来它自然接话,打断它立刻反应,弹幕和语音双通道驱动。在他看来,这是虎牙的场景优势:“大多数模型只学过怎么说,没学过怎么听。虎牙泡在直播间十几年,观众不会等你说完再发弹幕。场景,倒逼出了技术。”

据悉,VAM后续将分阶段持续迭代,在推理效率、模型表现力和成本优化三个方向同步推进,最终实现多模型融合与低成本人物风格定制。

红星新闻记者 郭晶晶

编辑 李星龙