1月29日,蚂蚁集团旗下具身智能公司——蚂蚁灵波科技正式开源其自主研发的可交互世界模型 LingBot-World。该模型不仅突破了传统视频生成模型在长时序一致性、物理真实感和交互可控性方面的瓶颈,更首次实现了“一张图生成可交互3D游戏环境”的能力,为机器人、自动驾驶、虚拟现实等具身智能领域提供了高质量、低成本的仿真训练平台。
突破“长时漂移”难题,实现近10分钟稳定生成
当前主流视频生成模型普遍存在“长时漂移”(long-term drift)问题——随着生成时间延长,画面中物体易发生形变、消失或场景结构崩塌,严重制约其在复杂任务中的应用。LingBot-World 通过多阶段训练策略与并行化加速架构,成功实现了近10分钟的连续、稳定、无损视频生成,大幅刷新行业纪录。
在官方压力测试中,即便摄像机视角离开核心区域长达60秒后返回,场景中的车辆、建筑等关键物体仍能保持结构完整、外观一致,展现出极强的长期记忆能力与空间一致性保障机制。

动作驱动、实时交互:从“看视频”到“玩游戏”
LingBot-World 的核心创新在于其动作条件生成(action-conditioned generation)能力。不同于传统仅依赖文本或图像提示的生成模型,LingBot-World 能够响应用户输入的动作指令(如键盘、鼠标操作),实时渲染符合物理规律的动态场景,实现真正意义上的“所控即所见”。
交互延迟低于1秒,支持约16 FPS的生成吞吐;
用户可实时控制角色移动、相机视角,画面即时反馈;
支持文本指令触发环境事件,如切换天气、改变画风,同时保持场景几何关系一致。
这意味着,只需输入一张城市街景照片或游戏截图,LingBot-World 即可自动生成一个可探索、可操控、可交互的3D级虚拟世界,无需针对特定场景重新训练,极大降低了部署门槛。

创新混合数据引擎,构建高质量训练闭环
为解决世界模型训练中高质量交互数据稀缺的行业痛点,LingBot-World 采用了一套混合数据采集策略:
1. 大规模网络视频清洗:覆盖多样化的现实场景;
2. 游戏与虚幻引擎(UE):从渲染层直接提取无UI干扰的纯净画面,并同步记录操作指令、相机位姿等结构化信息。
这一策略不仅提升了模型的Zero-shot泛化能力,还确保了生成内容在物理逻辑与因果关系上的合理性,使其成为具身智能体(如机器人)的理想“数字孪生训练场”。

构建具身智能基础设施,推动AGI生态落地
LingBot-World 并非孤立的技术展示,而是蚂蚁灵波“世界模型赋能具身智能”技术路线的关键一环。它与后续发布的 LingBot-Depth(空间感知)、LingBot-VLA(具身大模型)及 LingBot-VA(具身世界模型)共同构成完整的具身智能技术栈,分别对应“眼睛”“大脑”“模拟器”与“推演引擎”。
目前,LingBot-World 的模型权重与推理代码已全面开源,并通过 InclusionAI 社区向全球开发者开放。此举有望加速具身智能在工业自动化、家庭服务、科研仿真等真实场景的落地,推动通用人工智能(AGI)从“被动感知”迈向“主动交互”的新阶段。
开源地址:https://technology.robbyant.com/lingbot-world
适用场景:机器人仿真训练、自动驾驶测试、虚拟内容生成、教育与科研实验等。