据爱诗科技消息,爱诗科技发布最新技术报告,介绍PixVerse R2的整体架构与关键技术。该模型聚焦实时视频世界模型的持续Scaling,旨在构建能长期保持统一状态的动态世界,并将多模态输入内化进同一模型,实现边生成边交互的同步音视频输出。
R2将整体框架收敛为两个核心层次:Omni Causal AR(全模态因果自回归)与Real-Time Acceleration(实时加速)。前者持续扩展高质量、多模态和长程世界生成能力;后者在严格交互延迟约束下,尽可能无损地继承这些能力并加速到实时运行区间。
在全模态因果自回归方面,R2统一接收文本、参考内容、音频和动作等多模态输入,并输出同步音视频。为解决长期运行中的一致性问题,模型系统处理了四个关键问题:训练与推理分布差异、历史噪声鲁棒性、长期与近期记忆协同,以及错误状态纠正。具体技术包括:
- 动态分块生成:根据控制信号的语义边界与持续时间,自适应切分音视频序列,以统一不同交互时间尺度,同时获得敏捷交互与完整表达。
- 混合教师强制与扩散强制:在训练中混合干净历史与带噪历史,缩小训练与推理的分布差距,使模型在历史出现轻微偏差时仍能稳定推演。
- 多时间尺度记忆:构建由Sink Memory(保存长期锚点)、Rolling History(聚焦近期动态)和Object KV Cache(复用对象级表征)组成的记忆体系,在固定计算预算内兼顾长期身份稳定与短程运动连续。
- 误差库:将代表性错误历史状态沉淀为可复用样本并重新纳入训练,使模型主动学习识别和修复偏差。评测显示,长期亮度漂移指标下降约35.8%,有效改善了错误运动与角色状态偏离。
在实时加速方面,R2直接从完成长程Scaling的Omni Causal AR蒸馏实时加速层,使Teacher、Student与真实AR推理共享一致的因果轨迹分布。关键技术包括:
- 加入对抗正则的去噪分布匹配蒸馏:在DDMD基础上引入对抗正则,通过条件对齐、分布匹配和对抗正则三类信号,在极少采样步数下同时保证准确交互响应与可信世界真实感。
- 块稀疏注意力:将稠密注意力转化为对少量关键块的规整计算,注意力稀疏度提升至90%以上,同时保持效果基本无损,为更低延迟和更高分辨率生成释放计算预算。
- 金字塔式超少步蒸馏:通过低分辨率阶段确定全局结构,高分辨率阶段恢复细节,将“理解世界演化”与“恢复高频细节”分配到不同计算尺度,显著减少高分辨率空间中的重复计算。
报告指出,R2在严格实时计算约束下,单次生成质量与前沿离线视频生成模型相比仍有提升空间,尤其在复杂场景细节、运动自然度和长时间稳定性方面。这些差距反映了当前所处的Scaling阶段,而非框架能力上限。未来,团队将继续扩大模型容量、增加高质量多模态数据、延长训练时间尺度,并持续提升Omni Causal AR的能力上限与实时加速层的无损继承效率。目前,PixVerse R2处于内测阶段,用户可申请提前体验和API接入资格。
原文:爱诗科技发布世界模型研究最新进展,探索实时全模态世界模型的 Scaling 路径(来源:爱诗科技)
