量子位 14小时前
阿里22B模型实现实时分钟级稳定数字人生成,自定义角色流式交互模型开源
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

当数字人视频从数秒扩展到数分钟,生成系统面对的核心问题不再只是单帧质量,而是递归生成中的误差累积。

人物外观、场景布局和颜色可能逐段漂移,语音与口型同步也会随上下文更新而退化。与此同时,保留完整历史会使注意力和存储开销随时长增长,并反复将早期预测误差作为后续条件。

针对这一问题,来自阿里巴巴淘天集团与南京大学的研究团队提出TaoMate,一种面向少步联合音视频生成的锚点引导持久记忆框架

TaoMate 将带位置信息的短期上下文与固定容量的长期记忆分离,并以不可变视觉锚点约束动态状态更新;在此基础上,系统通过无需额外训练的阶段并行推理,在 3 张 GPU 上达到35.0 FPS的完整流水线输出速度。

背景:有限缓存与无限历史之间的矛盾

因果音视频生成通常依赖有界 KV Cache 保存近期动作、姿态和音素信息。它有利于局部连续,却会在窗口推进时丢失更早的人物、场景与声学证据。另一种做法是保留全部历史,但其计算量随视频长度持续增长,且旧的生成误差会被重复读取。长时生成因此需要同时满足三项约束:近期历史具有明确时间位置,长期条件不随视频时长扩张,递归预测中的异常结果不能持续污染未来。

TaoMate 的基本思路是将历史分解为" 有界活动上下文 " 和 " 固定容量持久记忆 "。前者负责细粒度运动与发音连续性,后者保存跨窗口仍然有效的视觉和声学证据,使条件规模与已生成时长解耦。

五分钟递归生成对比。TaoMate 在人物外观、场景与颜色上保持更稳定。技术方案锚点引导的多模态持久记忆

TaoMate 将持久记忆分解为固定参考与动态状态。固定部分包括由初始块构建的视觉锚点和音频参考;动态部分包括视频内容记忆、音频内容记忆、通道级外观统计和低频外观状态。已完成的音视频块先被压缩为固定数量的表示,再以停止梯度方式更新记忆,因此不会形成随时间无限增长的优化图。

动态状态采用锚点约束的在线更新。视频块与视觉锚点的一致性被转换为软门控:一致性较高的观察以更大权重进入记忆,偏离较大的观察被抑制;对于容易表现为色偏或对比度漂移的外观统计,系统还设置硬拒绝条件。该设计允许记忆适应合理的姿态、动作和语音变化,同时限制孤立误差长期传播。

TaoMate 框架。固定锚点与动态音视频记忆通过侧注意力和 Reference-Aware FiLM 共同提供长期条件。内容检索与外观调制解耦

内容结构与全局外观具有不同语义,不宜通过同一机制读取。TaoMate 使用模态专属的残差侧注意力检索视频结构和声学历史,记忆 K/V 始终位于活动缓存之外;固定的记忆 token 数使额外注意力开销不随生成时长增加。

对于颜色、亮度和低频场景信息,模型引入 Reference-Aware FiLM,同时利用动态外观状态与初始锚点统计对视频特征进行通道级调制。消融结果显示,仅加入无门控 FiLM 会削弱部分一致性收益;将持久记忆、FiLM 与锚点门控联合使用时,Long Consistency 达到0.9676,Color Δ 降至0.00276,说明外观调制需要以可靠的记忆更新为前提。

面向部署上下文的因果蒸馏

训练阶段的双向教师模型使用干净轨迹,而部署阶段的因果学生模型必须反复消费自身输出,两者存在上下文分布差异。TaoMate 通过混合不同 rollout 长度、按概率使用学生生成前缀,并扰动非锚点缓存历史,使学生在训练时接触更接近部署状态的累计误差。初始视觉锚点始终保持干净,从而在不可靠的近期历史之外提供稳定参考。训练目标进一步结合分布匹配蒸馏与视频 PCM 约束,提升相邻去噪阶段在 latent 及外观敏感特征上的一致性。

记忆感知的阶段并行推理

TaoMate 的学生生成器每个块执行 3 步去噪。串行方案需要完成一个块的全部阶段后再处理下一个块;TaoMate 则将不同去噪阶段分配到不同设备,使满足因果依赖的多个块沿反对角线并行推进。每个阶段维护独立 KV Cache,只有最终阶段的干净输出才能更新跨窗口记忆,部分去噪结果不会写入持久状态。该 " 干净提交 " 规则保持了串行记忆转移语义,因此阶段并行无需专门重训。

记忆感知的阶段并行推理。只有最终阶段的干净输出更新跨窗口记忆。实验结果

论文在中英文、固定镜头、单人场景上构建长时评测。内部方法生成 60 秒、768 × 512、24 FPS 的视频,每个案例由按时间排序的多段提示词驱动,动作和台词持续变化,人物、场景、镜头与声音描述保持一致。

在该基准上,TaoMate 取得5.918的 LipSync、0.000的 Desync、0.9755的 Long Consistency 和0.00260的 Color Δ。相较各指标最强外部结果,LipSync 提升9.7%,Long Consistency 提高 0.0136,Color Δ 降低51.9%。其 DiT 吞吐为16.32 FPS,是次高测量结果的 1.56 倍。需要区分的是,DiT FPS 不包含数据读取、VAE 解码和后处理;3 卡阶段并行报告的是完整生成流水线,达到35.0 FPS,超过 24 FPS 播放速率45.8%。单卡完整流水线为11.1 FPS

一分钟定性对比。列为不同时间点,行为不同生成方法。

除统一的 60 秒量化基准外,项目主页还展示了 5 至 6 分钟连续生成和 30 分钟不间断案例,用于观察更长时段的外观、场景与音画稳定性。相关演示不与论文基准指标混用。

从长视频生成到实时交互:数字人开始 " 在线对话 "

长视频稳定只是底层能力,最终还要进入可操作的交互链路。团队进一步搭建了实时交互网站原型:用户可选择家庭讲解员、科技主持人、商务顾问、课程讲师或健康顾问等预设角色,配置横竖屏比例与场景描述,输入对话文本后启动会话。录屏界面同步呈现缓冲、思考、直播与回放状态,展示了从提示词配置、音视频生成到流式播放的完整闭环。

交互式网站录屏。用户选择角色并输入文本后,系统以流式方式返回实时数字人视频。

该演示体现了 TaoMate 在产品形态上的意义:22.1B 生成器不仅能够连续生成长视频,还可在多轮交互中借助跨窗口记忆维持人物外观与场景条件,并以实时流水线支撑边生成边播放。

TaoMate 实时生成人物一致长视频项目价值

TaoMate 的价值在于同时处理长时一致性、音画同步与实时推理,而不是单独优化其中一项。固定容量记忆为直播数字人、虚拟讲解员和持续交互角色提供了时长无关的条件机制;锚点约束更新降低了递归误差扩散风险;阶段并行则将 22.1B 生成器推进到实时完整流水线。

当前评测仍集中于中英文单人场景,复杂镜头运动、多人交互和任意时长的细粒度事件记忆有待进一步研究。实际部署还应取得身份与数据授权,披露合成媒体并保留生成来源,防止未经授权的身份复制和误导性使用。

论文题目为:TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

论文作者:Qijun Gan、Chenwei Zhang、Meiguang Jin、Junfeng Ma 和 Qiu Shen

研究单位:阿里巴巴淘天集团与南京大学

论文:https://arxiv.org/abs/2607.24359

项目主页:https://taoliveaigc.github.io/TaoMate/

GitHub:https://github.com/TaoLiveAIGC/TaoMate

Hugging Face:https://huggingface.co/TaoLiveAIGC/TaoMate

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

评论
大家都在看