据量子位报道,爱诗科技已上线新一代实时世界模型PixVerse R2,该模型在保持实时交互的同时扩展了生成质量、长程一致性和多模态控制能力,上线后进入X平台热度总榜。爱诗科技此前于今年1月发布通用实时世界模型R1,主打持续生成能力。

报道称,R2的核心变化是把视觉、动作、音频、时序以及不同控制信号放进同一套可扩展的因果自回归建模框架。模型采用Omni Causal AR与Real-Time Acceleration两层架构:前者负责能力上限,通过动态Chunk适配不同时间尺度,并用Hybrid Teacher/Diffusion Forcing、多时间尺度记忆和Error Bank处理长程生成中的误差累积、角色漂移与状态断裂;后者把通用能力蒸馏进实时加速层,使其在实时计算预算内运行。

爱诗科技将Scaling拆分为模型、数据、任务、控制信号和时间尺度五个协同增长的维度。报道称,模型规模决定容量,数据拓宽世界分布,任务强化跨场景迁移,控制信号增加交互精度,时间尺度决定模型能把多长、多复杂的动态过程纳入建模,任一维度增加资源都能反过来增益其他维度。R2的做法是先提高基础模型的能力上限,再单独解决实时化,使实时世界模型的天花板不完全由单帧计算预算决定。

实时世界模型的能力扩展长期受两道工程门槛制约。报道指出,图像和视频是连续、高维且高度冗余的信息形态,视觉领域缺少像文本Token那样紧凑、统一、可持续扩展的表征体系;同时,维持稳定实时生成时,每帧留给模型的计算窗口可能只有几十毫秒,而理解更复杂场景与更长程的时空变化需要更大的模型容量和更复杂的建模。Google DeepMind在2024年发布的11B参数Genie已能生成可交互环境,Genie 2在场景和物理能力增强后实时性更难兼顾,跑实时往往需要以蒸馏为代价并牺牲部分画质。

在功能演示中,报道描述了奥德赛草原风格场景和魔法学院互动影游两类体验:用户用WASD控制视角与方向,通过Prompt修改角色动作和剧情走向,并可输入攻击魔法,让画面顺着指令继续生成。报道称体验过程中几乎没有卡顿和延时,画面、交互与记忆能力同时在线。

爱诗科技长期面对亿级用户,需求分散、场景持续变化。报道认为,这套架构的外溢价值可能延伸到内容生产、具身智能、虚拟人和游戏实时渲染等方向,互动娱乐中的剧情、场景和角色也可能从预先写好的固定内容,变成随用户行为持续展开的动态系统。