智元机器人发布全球首个统一世界模型平台GE:开启具身智能"视觉→动作"端到端时代

8.15 智元机器人8月14日正式发布行业首个面向真实世界机器人操控的统一世界模型开源平台GenieEnvisionerGE,该平台突破传统机器人学习系统的分阶段开发模式,首次将未来帧预测策略学习与仿真评估整合进以视频生成为核心的闭环架构,实现机器人从看到想再到动的端到端推理与执行

智元机器人8月14日正式发布行业首个面向真实世界机器人操控的统一世界模型开源平台——Genie Envisioner(GE),该平台突破传统机器人学习系统的分阶段开发模式,首次将未来帧预测、策略学习与仿真评估整合进以视频生成为核心的闭环架构,实现机器人从“看”到“想”再到“动”的端到端推理与执行。  

 

与传统依赖视觉-语言-行动(VLA)的方法不同,GE直接在视觉空间中建模机器人与环境的交互动态,完整保留操控过程中的空间结构和时序演化信息,从而显著提升跨平台泛化能力和长时序任务执行精度。  


2025081502

 

跨本体泛化能力:仅需1小时(约250个演示)的遥操作数据即可适配新机器人平台,远超现有SOTA方法(如π0和GR00T)。  

长时序任务执行:在折叠纸盒(10+步骤)等复杂任务中,GE-Act成功率高达76%,远超同类模型的48%(π0)和0%(UniVLA/GR00T)。  


2025081503

 

三大核心组件协同工作  

1. GE-Base(基础生成模型):采用自回归视频生成框架,支持多视角输入与稀疏记忆机制,增强长时序推理能力。  

2. GE-Act(动作执行模块):轻量级架构(160M参数)实现视觉→动作的高效转换,支持毫秒级实时响应。  

3. GE-Sim(仿真评估):基于动作条件的神经仿真器,可生成多样化训练数据并支持闭环策略优化。  

 

智元机器人宣布开源全部代码、预训练模型及评测工具,并推出EWMBench评测套件,以推动机器人从“被动执行”向“想象—验证—行动”的智能范式转变。未来,GE将扩展多传感器融合与全身移动控制,加速在智能制造、物流、服务机器人等领域的落地应用。  

 

此次发布标志着机器人智能化发展迈入新阶段,有望重塑行业技术路线,推动具身智能的规模化商用。

 

开源链接:

Project page:https://genie-envisioner.github.io/ 

Arxiv:https://arxiv.org/abs/2508.05635 

Github:https://github.com/AgibotTech/Genie-Envisioner