3月17日,理想汽车基座模型负责人詹锟出席NVIDIA GTC 2026,发布下一代自动驾驶基础模型MindVLA-o1(Mind Vision-Language-Action o1),通过五大技术创新构建面向物理世界的智能体,让自动驾驶"看得更远、想得更深、行得更稳、进化更快、部署更高效"。
技术突破:VLA统一架构
MindVLA-o1的核心创新在于视觉-语言-动作(VLA)统一架构:
看得更远:3D高斯表征与链式推理,支持超长时序规划
想得更深:快慢双系统协同,快系统实时响应,慢系统深度推理
行得更稳:基于世界模型的端到端训练,提升复杂场景泛化能力
进化更快:云端世界模型持续学习,车端模型实时更新
部署更高效:模型蒸馏与量化技术,降低车端算力需求
战略意义:从自动驾驶到具身智能
詹锟表示:"当我们把视觉、语言和行动统一到一个模型中时,它已不再只是自动驾驶模型,而是在逐渐演化为面向物理世界的通用智能体。基于同一套VLA模型,不仅可以控制车辆,也能够扩展到机器人。因此,自动驾驶只是物理AI的起点,未来这类基础模型将驱动新的具身智能范式。"
这标志着理想汽车从"造车新势力"向"AI科技公司"的转型,也与何小鹏"具身智能将成新兴支柱产业"的预言形成呼应。