Zing-0.5:开源实时交互视频世界模型,键盘操控+文字改写,单卡24FPS
更新时间:2026-08-30 20:18:49 发布时间:18小时前 阅读:3次Zing-0.5 是 Loopit 在 2026 年开源的实时交互视频世界模型,基于 Wan2.2-TI2V-5B 训练,5B 参数,采用 Apache 2.0 协议。它最大的特点是“联合控制”:你可以一边用键盘操控角色移动,一边随时用文字改写正在发生的世界,比如输入“暴风雪”,场景立即变化,而角色和画风保持不变。本文从功能、原理、部署、竞品对比等角度全面解析 Zing-0.5,帮你快速判断它是否适合你的项目。
一句话结论:Zing-0.5 是当前 WBench 实时世界模型榜排名第一的开源模型,支持键盘空间操作与自然语言语义改写双链路联合控制,单卡 RTX 5090 即可超 24 FPS 实时生成,一分钟推理成本约 6 分钱,适合 AI 互动游戏、可玩视频和虚拟直播等场景。
关键数据:参数:5B · 基座:Wan2.2-TI2V-5B · 协议:Apache 2.0 · WBench实时榜第一 · 成本:约 6 分钱/分钟 · 帧率:>24 FPS
Zing-0.5 是什么
Zing-0.5 是 Loopit(SeedLeap)开源的实时交互视频世界模型,5B 参数,基座为 Wan2.2-TI2V-5B,采用 Apache 2.0 协议。它的核心能力是“联合控制”:键盘空间操作(W/A/S/D 移动 + I/J/K/L 视角)与自然语言语义改写两条链路共同进入 Causal DiT,用户可一边操控角色移动,一边随时用文字改写正在发生的世界,新指令会进入当前世界而非重置场景。模型通过训练中途切换 Prompt 学会“边玩边改”,主动扰动历史画面以抗误差累积。单卡 RTX 5090 可超 24 FPS 实时生成,一分钟流式推理成本约 6 分钱,在美团 LongCat 与复旦联合的 WBench 评测中位列实时世界模型第一。
Zing-0.5 的主要功能
- 联合控制:键盘空间操作(W/A/S/D 移动 + I/J/K/L 视角)与自然语言语义改写共同作用,一边操控移动一边用文字改变世界,新指令进入当前世界而非替换场景。
- 实时流式生成:单卡 RTX 5090 超过 24 FPS,一分钟推理成本约 6 分钱,支持无限长时序连续生成。
- 中途语义改写:可在生成进行中随时插入文字指令(如“暴风雪”“龙喷火”),模型保留视觉与操作历史,让改写发生在当前世界中。
- 多对象同时响应:一条指令可同时驱动多个不同对象变化(如人物跪地祈祷 + 多座雕像睁眼发光)。
- 长程一致性:角色外观、场景结构、画风(如像素风格)在持续生成中保持稳定,不漂移、不换画风。
- 抗误差累积:训练中主动扰动历史画面,模型学会“接住自己的错误”,长时间生成不越走越偏。
- 动作控制:8 维连续动作信号(取值 [0,1]),支持前进/后退/左右移动与四向视角变化,编码为逐帧 action residual。
- 本地部署:5B 参数单卡可跑,Linux + PyTorch 环境,80GB+ 显存或滑窗注意力配置(RTX 4090 级别亦可),输出 H.264 MP4。
- 开源免费:Apache 2.0 协议,代码与权重在 GitHub、ModelScope、HuggingFace 开放,基于 Wan2.2-TI2V-5B 训练。
Zing-0.5 的技术原理
- 基座模型:基于 Wan2.2-TI2V-5B 训练,5B 参数量级,核心生成网络为 Causal DiT(因果扩散 Transformer),配合因果 KV 缓存支持无限长时序自回归推演。
- 双控制链路架构:两条独立但共同进入 Causal DiT 的控制通道——空间操作走“动作链”,语义改写走“文本链”,二者共同决定接下来生成的内容。
- 动作链(action residual):W/A/S/D 移动 + I/J/K/L 视角构成 8 维连续动作信号(取值 [0,1]),经 sin/cos 编码与因果时序卷积(不足 10M 参数)转化为逐帧 action residual,与对应视频 token 逐帧对齐后注入生成。
- 文本链(cross-attention):自然语言指令经语言模型编码为 language tokens,通过 cross-attention 写入当前生成,实现中途语义改写。
- 两链解耦、持续并行:文本条件改变时动作链路不中断,因此能实现“巨龙一边按原方向飞行一边喷火”这类边操作边改写的效果。
- 训练即学会“中途改写”:训练时在自回归生成中途切换 Prompt,保留已生成的视觉历史与操作历史,用新文本条件预测后续,改写能力是训练出来的原生能力,而非推理时拼接的后加功能。
- 抗误差累积训练:自回归生成的“历史”是模型自己的输出,误差会累积;Zing-0.5 在训练中主动扰动部分历史画面(加噪声、轻微模糊、颜色偏移、视角变化)模拟真实误差,训练目标始终保持干净,迫使模型学会从不完美历史中甄别真实状态。
- 纯训练解法,推理零开销:抗累积能力完全内化于权重,在线推理无需额外纠错模型,不增加延迟与算力。
- 四步 DMD 蒸馏采样:将扩散采样压缩至 4 步,是单卡实时(>24 FPS)与低成本(约 6 分钱/分钟)的关键。
- 滑窗注意力适配显存:80GB+ 显存用
--local-attn-size 97 --sink-size 9;RTX 4090 级别用--local-attn-size 33 --sink-size 5,通过局部注意力 + sink token 在有限显存内维持长上下文。 - 输出管线:视频帧经 patch embedding 成 token 进入 Causal DiT,预测帧解码后输出 H.264 编码的 24 FPS MP4。
Zing-0.5 如何使用
快速体验:如果你不想本地部署,可以等待 Loopit APP 海外版上线,官方预计两周内推出对应功能,直接在 App 中体验实时互动世界。
本地部署:适合开发者,最低要求 Linux 系统 + NVIDIA GPU(RTX 4090 级别即可,使用滑窗注意力配置),80GB+ 显存效果最佳。
- 环境准备:安装 Python 3.11、PyTorch 2.9、CUDA。
- 获取代码:
git clone https://github.com/seedleap/zing-world-model.git,进入目录cd zing-world-model。 - 安装依赖:
pip install -r requirements.txt。 - 下载权重:
pip install modelscope,然后执行modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5。 - 运行推理:执行
run.sh,指定--pretrained-dir、--checkpoint、--messages等参数。文本驱动用examples/case3_action_t2v.jsonl,图片初始化用examples/case4_action_ti2v.jsonl。 - 交互操作:键盘 W/A/S/D 控制移动,I/J/K/L 控制视角;生成过程中直接输入文字指令即可改写世界。
- 查看输出:生成的 H.264 MP4 文件保存在
--output-dir指定的目录中。
Zing-0.5 与竞品对比
一句话结论:如果你需要实时交互和文字改写,Zing-0.5 是当前最佳选择;若更看重画面质量,HiDream-O1-World 略胜一筹。
| 对比项 | Zing-0.5 | HiDream-O1-World | LingBot-World v2 |
|---|---|---|---|
| WBench 总排名 | 第 2(实时榜第 1) | 第 3 | 第 5 |
| 综合平均分 | 81.0 | 80.9 | 79.4 |
| 画面质量 | 80.6 | 81.0(最高) | 81.8(最高) |
| 场景设定 | 77.8 | 82.2 | 76.8 |
| 交互能力 | 84.2(最高) | 80.0 | 82.8 |
| 一致性 | 88.5(最高) | 88.0 | 86.5 |
| 物理规律 | 73.8(最高) | 73.3 | 69.1 |
| 实时性 | 实时(单卡 5090 超 24 FPS) | 未标注 | 快速 |
| 交互类型 | 动作 + 文本联合控制(可中途改写世界) | 动作控制 | 动作控制 |
| 参数规模 | 5B | 未公开 | 未公开 |
| 开源情况 | Apache 2.0,代码+权重 | 未标注 | 开源 |
| 推理成本 | 约 6 分钱/分钟 | 未公开 | 未公开 |
Zing-0.5 的应用场景
- AI 互动娱乐 / AI 游戏:玩家用键盘操控角色在生成世界中探索,随时用语言改写剧情与环境(如下雪、召唤怪物),实现“人人可玩的生成式游戏”。
- “可以玩的抖音”式内容消费:短视频从“看”变成“玩”,每个用户在同一段内容里玩出不同走向,改写内容平台形态。
- UGC 互动内容创作:创作者生成可交互视频世界供粉丝体验,观众不再是旁观者而是参与者,衍生全新内容品类。
- 游戏原型快速验证:游戏团队无需搭建引擎场景,用世界模型快速生成可交互 Demo,低成本验证玩法与关卡创意。
- 虚拟直播 / 虚拟主播:主播实时驱动虚拟世界,观众通过弹幕文字参与改写场景与事件,增强直播互动性。
Zing-0.5 的优点与缺点
优点
- 实时榜第一的硬实力,WBench 综合平均分 81.0。
- “边玩边改”独一档,多数实时世界模型只支持探索场景,Zing-0.5 是少数能边操控移动边用文字中途改写世界的模型。
- 改写不换世界,新指令精准写入当前世界,只改该改的,不该动的纹丝不动。
- 长时序不跑偏,训练中主动扰动历史画面让模型学会纠错,且纯训练解法推理零开销。
- 成本与门槛双低,5B 参数单卡部署,单张 RTX 5090 超 24 FPS,一分钟流式推理仅约 6 分钱。
- 真开源,Apache 2.0 协议,代码 + 权重 + 部署文档全套开放,商用无门槛。
缺点
- 本地部署有一定技术门槛,需要 Linux 环境和 PyTorch 经验。
- 80GB 以下显存需使用滑窗注意力,可能牺牲部分长程一致性。
- 目前仅提供命令行交互,暂无图形界面(官方 APP 尚未上线)。
- 生成内容为 H.264 MP4,实时交互体验依赖本地算力,普通笔记本难以流畅运行。
Zing-0.5 是免费开源的吗?
是的。Zing-0.5 采用 Apache 2.0 协议,代码和模型权重在 GitHub、HuggingFace、ModelScope 上完全开放,可免费商用。
Zing-0.5 需要什么显卡才能运行?
最低要求 NVIDIA GPU,RTX 4090 级别即可使用滑窗注意力配置运行。推荐 80GB 以上显存(如 H100/A100)以获得最佳效果,单卡 RTX 5090 可超过 24 FPS 实时生成。
Zing-0.5 和 HiDream-O1-World 有什么区别?
Zing-0.5 主打实时交互和文字中途改写,WBench 实时榜第一;HiDream-O1-World 在画面质量和场景设定上略占优势,但未标注实时能力。如果你需要边操控边改写世界,选 Zing-0.5;如果更看重静态画面质量,可考虑 HiDream。
如何本地部署 Zing-0.5?
准备 Linux 系统 + NVIDIA GPU,安装 Python 3.11、PyTorch 2.9、CUDA,克隆 GitHub 仓库并安装依赖,通过 ModelScope 下载权重,然后运行 run.sh 并指定参数即可。详细步骤见上文“Zing-0.5 如何使用”。
Zing-0.5 生成的视频可以商用吗?
可以。Zing-0.5 采用 Apache 2.0 开源协议,代码和权重均允许商业使用,无需支付授权费用。
Zing-0.5 支持图片初始化吗?
支持。除了纯文本驱动(Action T2V),还支持图片初始化模式(Action TI2V),可上传一张图片作为起始帧,然后进行实时交互和文字改写。
Zing-0.5 的推理成本是多少?
单卡 RTX 5090 上一分钟流式推理成本约 6 分钱,这是四步 DMD 蒸馏采样带来的高效推理优势,消费级显卡也能负担实时交互。