一、联合控制架构:动作链与文本链并行解耦
Zing-0.5将键盘空间操作与自然语言语义改写两条独立链路共同送入Causal DiT。空间操作走"动作链",由WASD移动加IJKL视角构成8维连续动作信号(取值[0,1]),经sin/cos编码与因果时序卷积转化为逐帧action residual;语义改写走"文本链",由语言模型编码为language tokens并通过cross-attention写入当前生成。两链解耦、持续并行,因此能实现"一边按原方向飞行一边喷火"这类边操作边改写的效果——动作控制移动轨迹,文本改写内容细节,两者互不干扰。
二、实时流式生成与中途语义改写
借助因果KV缓存与四步DMD蒸馏采样,Zing-0.5将扩散采样压缩至4步,在单张RTX 5090上即可超过24 FPS实时生成,一分钟流式推理成本约6分钱,并支持无限长时序连续生成。滑窗注意力进一步适配显存:80GB+显存用97/9配置,RTX 4090级别用33/5配置,即可在有限显存内维持长上下文与实时交互。
模型在自回归生成中途即可插入文字指令(如"暴风雪""龙喷火"),新指令精准写入当前世界、只改该改的部分,角色、画风与远处场景纹丝不动。这种"改写不换世界"的能力是训练出来的原生能力——训练时在生成中途切换Prompt,保留已生成的视觉与操作历史,用新文本条件预测后续,而非推理时拼接的后加功能。
在持续生成中,角色外观、场景结构与画风保持稳定、不漂移、不换画风。抗误差累积能力完全内化于权重:训练中主动扰动部分历史画面模拟真实误差,迫使模型学会"接住自己的错误",长时间生成不越走越偏,且是纯训练阶段解法,在线推理无需额外纠错模型,不增加延迟与算力。
三、WBench评测表现
在美团LongCat与复旦联合推出的WBench实时世界模型评测中,Zing-0.5的关键指标如下:
| 对比维度 | Zing-0.5 | HiDream-O1-World | LingBot-World v2 |
|---|---|---|---|
| WBench总排名 | 第2(实时榜第1) | 第3 | 第5 |
| 综合平均分 | 81.0 | 80.9 | 79.4 |
| 交互能力 | 84.2 | 80.0 | 82.8 |
| 一致性 | 88.5 | 88.0 | 86.5 |
| 物理规律 | 73.8 | 73.3 | 69.1 |
| 实时性 | 实时(单卡5090超24 FPS) | 未标注 | 标注"fast" |
| 交互类型 | action+文本联合控制 | 动作控制 | 动作控制 |
| 开源情况 | 开源(Apache 2.0) | 未标注 | 开源 |
从数据可以看出,Zing-0.5以5B轻量参数在实时世界模型榜位列第一,交互能力与一致性均为同榜最高,且是少数支持"边操控边文字改写世界"的联合控制模型。
在AI工具导航的框架下,Zing-0.5属于"开源视频生成"类目下的实时交互子类,与一次性文生视频模型形成明确区隔。它的价值在于让开发者可以基于5B参数、单卡消费级GPU即可搭建可交互的视频世界,而不需要部署数十B的旗舰模型。对于游戏原型、互动剧情和UGC视频创作等场景,这种低成本、可交互的开源方案正在成为AI视频创作工具链中不可或缺的一环。
四、应用场景与适用人群
-
游戏原型与互动剧情:以实时交互方式快速搭建可操作的世界模型原型与分支剧情
-
短视频与UGC创作:用文本或图像驱动生成可改写的视频片段,降低创作门槛
-
虚拟直播与数字人:为虚拟主播、互动直播等提供实时可控的视频生成能力
适用人群:游戏与互动娱乐开发者、短视频与UGC内容创作者、虚拟直播团队,以及希望以极低门槛体验实时世界模型的AI爱好者。对于需要"可交互、可改写"视频世界的团队,Zing-0.5的开源方案提供了一个明确的低成本起点。
五、如何使用Zing-0.5
代码、权重与文档均以Apache 2.0协议在GitHub、HuggingFace(seedleap/zing-0.5)与ModelScope(seedleap/Zing-0.5)三平台同步开放。本地部署步骤:克隆代码仓库,安装依赖,通过ModelScope拉取权重,运行推理脚本即可启动世界推演。生成过程中用WASD移动、IJKL转动视角,并随时输入自然语言指令改写世界。对于不想本地部署的用户,Loopit APP海外版预计两周内上线,提供开箱即用的实时互动世界体验。
六、开源与成本
Zing-0.5以Apache 2.0协议完全开源,商用无门槛。单卡RTX 5090可超24 FPS实时生成;RTX 4090级别可用33/5滑窗注意力配置实时运行;H100/A100 80GB+用97/9配置进行离线推理。流式推理成本约6分钱/分钟,在实时交互视频生成模型中属于极低门槛。
