加利福尼亚州圣地亚哥 — 在近日举行的NeurIPS 2024人工智能大会上,芯片制造商英伟达宣布推出一套全新的开源人工智能模型与开发工具,旨在推动“物理人工智能”(Physical AI)技术的发展,为自动驾驶汽车和智能机器人等能与现实世界交互的系统奠定技术基础。

作为此次发布的核心,英伟达推出了名为 Alpamayo-R1 的开放式视觉语言动作模型(VLA)。据官方介绍,这是业界首个专为自动驾驶研究设计的视觉语言动作模型,能够同步处理图像与文本信息,使车辆具备理解环境并据此作出决策的能力。该模型基于英伟达此前开发的 Cosmos-Reason 推理架构,具备“思考”能力,可在响应前进行因果推理,从而提升复杂交通场景下的决策质量。
英伟达表示,Alpamayo-R1 的目标是赋予自动驾驶系统类似人类的“常识”,以支持 L4 级高度自动驾驶的实现。目前,该模型已在 GitHub 和 Hugging Face 平台开源,供全球研究者和开发者使用。
与此同时,英伟达还发布了名为 “Cosmos Cookbook” 的配套开发资源包,包含数据整理、合成数据生成、模型评估等环节的分步指南与工具,旨在帮助开发者更高效地定制和优化基于 Cosmos 架构的模型。
英伟达首席执行官黄仁勋此前多次指出,物理人工智能将是下一波AI浪潮的核心。公司首席科学家比尔·戴利也强调,未来机器人将在社会中扮演关键角色,而英伟达致力于成为“所有机器人之脑”的缔造者。此次 Alpamayo-R1 与 Cosmos Cookbook 的发布,正是其在该战略方向上的重要一步。