Skills Plugins MCP Prompt Model 导航 博客 资讯 我的中心

一张消费级显卡,也能实时生成一个世界:LingBot-World 2.0 再开源三款模型

继今年 7 月开源 LingBot-World 2.0 14B 模型后,今天,我们进一步开放三款模型:LingBot-World 2.0 Small(1.3B)、LingBot-World 2.0 Bidirectional 和LingBot-World 2.0 Causal Pretrain。 这一次,我们首先希望解决一个更直接的问题:当世界模型已经能够长时间持续生成、实时响应操作并不断创造新事

Article

继今年 7 月开源 LingBot-World 2.0 14B 模型后,今天,我们进一步开放三款模型:LingBot-World 2.0 Small(1.3B)、LingBot-World 2.0 Bidirectional 和LingBot-World 2.0 Causal Pretrain。


这一次,我们首先希望解决一个更直接的问题:当世界模型已经能够长时间持续生成、实时响应操作并不断创造新事件,怎样让更多开发者真正把它跑起来?


1.3B 小模型面向消费级单卡 GPU,可在单卡上实现实时世界生成;Bidirectional 与 Causal Pretrain 则进一步开放模型蒸馏和因果预训练能力。我们希望让 LingBot-World 2.0 不仅可以被体验,也更容易被运行、研究和改进。

从持续生成一个世界,

到让更多人把它跑起来



LingBot-World 2.0 是一个实时交互世界模型。在此前 7 月发布的 14B 主模型中,我们重点推进了长时序稳定性、实时生成和交互能力。模型支持小时级连续生成,并可以响应攻击、射箭、施法、射击等角色动作,以及下雪、下雨等环境事件。Pilot Agent 与 Director Agent 组成的 Agentic Interaction Harness,则协同完成角色行为与环境内容生成,让世界在探索过程中继续演化。在更高算力与相应推理配置下,LingBot-World 2.0 可进一步达到 720P / 60FPS 的高清实时体验。


相关阅读:无限世界,实时交互:LingBot-World 2.0 正式开源!


然而,持续生成高清画面,并及时响应用户操作,仍对算力、显存和推理系统提出了较高要求。对于个人开发者、高校实验室和小型团队而言,能够看到一个世界模型,并不等于能够在本地运行它。这正是我们此次首先希望改变的事情。

1.3B 小模型:

让实时世界跑上消费级单卡



本次开源的 LingBot-World 2.0 Small 采用 1.3B 参数规模,面向消费级单卡 GPU 设计,可在单卡上实现实时生成。


模型变小所带来的变化,不只是一组参数数字。过去,开发者可能更多通过公开视频或在线 Demo 观察世界模型的能力;现在,他们可以在本地直接运行模型,观察连续生成过程,修改输入方式,测试不同的交互设计,并搭建应用原型。


这让个人开发者、高校实验室和小型团队也可以从本地体验和复现开始,进一步探索交互方式、推理优化与场景应用。


Bidirectional:

为更轻、更快的模型提供蒸馏源



仅仅开放一个可以直接运行的小模型,还不足以支持社区继续训练和改进世界模型。因此,本次我们同步开放 LingBot-World 2.0 Bidirectional,即双向 Teacher 模型。


它面向实时世界模型训练,提供高质量的蒸馏源。高质量生成通常需要多步去噪,计算成本较高,难以直接满足实时交互需求。通过蒸馏,可以将 Teacher 的多步生成轨迹压缩到少步 Student,在降低生成成本的同时,尽可能保留预训练阶段学习到的动作条件动态能力。


在 LingBot-World 2.0 的技术路径中,我们结合一致性蒸馏与分布匹配蒸馏:前者用于减少去噪步数,后者进一步改善视觉保真度,并抑制 Student 在长时序自回归过程中不断累积误差。


通过开放 Bidirectional,我们希望为研究者提供更完整的蒸馏起点,用于训练更轻、更快,或更适合特定场景的 Student 模型。


Causal Pretrain:

开放世界模型的因果预训练底座



本次开放的第三款模型是 LingBot-World 2.0 Causal Pretrain。它面向后训练、评测和场景适配,提供因果预训练底座。


在 LingBot-World 2.0 中,当前世界状态只依赖过去的视觉观察,以及截至当前时刻的用户输入,不能访问未来信息。Causal Pretrain 支持相机位姿与文本提示(Prompt)两类输入,让用户既可以控制移动和视角,也可以通过文本改变局部事件与世界状态。


为了兼顾自回归生成与视觉质量,我们引入 Mixture of Bidirectional and Autoregressive Attention Mask(MoBA)。它在 Teacher Forcing 掩码中加入双向注意力组件,用于缓解纯 Teacher Forcing 带来的过拟合和画质下降,并帮助模型从双向生成过渡到自回归生成。与之配套的因果交叉注意力,则用于防止未来语义泄漏,同时保留灵活的交互控制能力。


技术报告中的定性对比显示,Causal Pretrain Backbone 在较长生成过程中能够更好地保持清晰纹理、稳定几何结构和场景连贯性,为后续实时模型提供更稳定的预训练基础。

本轮开放的三款模型,让开发者既可以直接运行 1.3B 小模型,也可以从 Causal Pretrain 或 Bidirectional 出发,继续开展后训练、评测、蒸馏、压缩、推理加速和特定场景适配。我们希望逐步完善世界模型从研究到应用的开源体系:让更多人能够跑起来,也让研究者能够在此基础上继续训练、蒸馏和创造。


欢迎访问项目页面,体验并下载相关模型。我们期待继续与开源社区一起,探索实时交互世界模型的更多可能。


  • 项目主页:

    https://technology.robbyant.com/lingbot-world-v2

  • Hugging Face:

    https://huggingface.co/robbyant/lingbot-world-v2

  • 魔搭社区:

    https://www.modelscope.cn/collections/Robbyant/LingBot-World-V2

  • 代码:

    https://github.com/robbyant/lingbot-world-v2

  • 技术报告:

    https://arxiv.org/abs/2607.07534


点击「阅读原文」,访问项目页面!

Source: a public AI news aggregator. Copyright belongs to the original authors and outlets; this site only indexes and summarises. Contact us for removal.

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。