蚂蚁灵波开源具身世界模型 LingBot-VA:让机器人“边推演、边行动”,迈向通用智能新范式

1.30 该框架将大规模视频生成模型与机器人控制深度融合,使模型在生成下一步世界状态的同时,直接推演并输出对应的动作序列

1月30日,蚂蚁集团旗下灵波科技正式开源其最新成果——具身世界模型 LingBot-VA。这是继空间感知模型 LingBot-Depth、具身大模型 LingBot-VLA 与通用世界模型 LingBot-World后,灵波科技在具身智能领域的“第四连发”,标志着其“世界模型赋能具身操作”技术路线的全面成型。

 

首创自回归视频-动作世界建模框架

 

LingBot-VA 的核心突破在于其首创的自回归视频-动作世界建模框架。该框架将大规模视频生成模型与机器人控制深度融合,使模型在生成“下一步世界状态”的同时,直接推演并输出对应的动作序列。这一机制让机器人摆脱了传统“感知-规划-执行”的割裂模式,真正实现像人类一样“边推演、边行动”的连续智能行为。

 

真机与仿真评测均刷新行业纪录

 

在极具挑战性的真机评测中,LingBot-VA 展现出对复杂物理交互的强适应能力。面对长时序任务(如制作早餐、拾取螺丝)等三大类六项高难度挑战,模型仅需 30~50 条真机演示数据即可完成适配,且任务成功率相较业界强基线 Pi0.5 平均提升 20%。


2026013003

 

在仿真环境中,LingBot-VA 的表现更为惊艳。在高难度双臂协同操作基准 RoboTwin2.0 上,它首次将任务成功率提升至 超过 90%;在长时序终身学习基准 LIBERO 上,更是达到了 98.5% 的平均成功率,双双刷新了行业纪录。


20260103004




技术创新:为端侧落地扫清障碍

 

为解决大规模视频世界模型在机器人端侧部署面临的计算瓶颈,LingBot-VA 引入了一系列创新设计:

  • 异步推理管线:将动作预测与电机执行并行化处理,显著降低延迟。

  • 基于记忆缓存的持久化机制:减少冗余计算,提升推理效率。

  • 噪声历史增强策略:增强模型鲁棒性,确保在真实、嘈杂环境中也能稳定输出精确指令。

 

这些优化使得 LingBot-VA 在保有大模型强大理解能力的同时,兼具了真机低延迟控制所需的响应速度,为世界模型从实验室走向真实产业场景铺平了道路。

 

构建具身智能AGI生态

 

LingBot-VA 并非孤立存在,而是灵波科技构建的完整具身智能技术栈的关键一环。此前开源的 LingBot-Depth(“机器人眼睛”)、LingBot-VLA(“机器人大脑”)和 LingBot-World(“通用模拟器”)共同构成了一个从感知、决策到行动的闭环体系。LingBot-VA 的加入,则为这个体系注入了“前瞻推演”的核心能力。

 

蚂蚁灵波表示,将持续依托 InclusionAI 社区推进开源开放,与行业共建具身智能基础能力,加速构建一个深度融合、服务于真实产业场景的AGI生态。目前,LingBot-VA 的模型权重与推理代码已全面开源,为全球研究者和开发者提供了探索下一代机器人智能的宝贵工具。