AI 栩栩如生:从调酒师到外科助手再到小狗,未来的机器人正在路上

1.21 Cosmos是一系列AI世界基础模型,可帮助机器人理解物理和空间关系,而GR00T通才机器人00技术则允许机器人通过观察人类来学习,就像学徒向师傅学习一样

20250121111042


人形机器人不再是科幻小说中的内容。想象一下这样一个世界:机器人不仅在工厂与我们合作,而且在商店里迎接我们,协助手术并照顾我们所爱的人。随着特斯拉计划到 2026 年部署数千个 Optimus 机器人,人形机器人的时代比我们想象的要近。


随着越来越多的公司展示突破性的创新,这一愿景变得越来越具体。2025 年消费电子展 (CES) 展示了机器人技术如何在功能和以人为本的设计方面取得进步的几个例子。其中包括 Richtech Robotics 的机器人调酒师 ADAM,它可以混合 50 多种饮料并与客户互动,以及 Tombot Inc. 的小狗,它们摇着尾巴并发出声音,旨在安抚患有痴呆症的老年人。虽然展会上展出的这些机器人和其他机器人可能有市场,但广泛部署此类机器人技术仍处于早期阶段。


尽管如此,该领域正在取得真正的技术进步。这越来越多地包括“类人”机器人,它们使用生成式 AI 创造更像人类的能力——使机器人能够在复杂的环境中学习、感知和行动。从特斯拉的 Optimus 到 Realbotix 的 Aria,未来十年将看到人形机器人的激增。


20250121111103
与“Aria”的对话。资料来源:CNET https://youtu.be/2HQ84TVcbMw


尽管取得了这些令人鼓舞的进步,但一些专家警告说,实现完全类似人类的能力仍然是一个遥远的目标。“人工智能教父”之一 Yann LeCun 最近指出,人工智能系统“没有能力规划、推理......或理解物理世界”。他补充说,我们今天无法制造足够智能的机器人,因为“我们无法让它们足够智能”。


LeCun 可能是正确的,尽管这并不意味着我们不会很快看到更多的类人机器人。埃隆马斯克最近表示,特斯拉将在 2025 年生产数千辆 Optimus,他预计到 2026 年将出货 50,000 至 100,000 辆。与目前存在的少数执行限制功能的产品相比,这是一个巨大的增长。当然,众所周知,马斯克的时间表是错误的,例如他在 2016 年表示将在两年内实现完全自动驾驶。


尽管如此,很明显,人形机器人正在取得重大进展。特斯拉并不是唯一一个追求这一目标的公司,包括 Agility Robotics、Boston Dynamics 和 Figure AI 在内的其他公司都是人形机器人领域的领导者。


Business Insider 最近与 Agility Robotics 首席执行官 Peggy Johnson 进行了交谈,后者表示,人形机器人很快就会在各种工作场所与人类成为同事。上个月,Figure 在 LinkedIn 帖子中宣布:“我们向商业客户交付了 F.02 人形机器人,他们目前正在努力工作。在包括 Microsoft 和 Nvidia 在内的主要投资者的大力支持下,Figure 将为人形机器人市场提供激烈的竞争。


20250121111118
图 02 在宝马工厂工作的人形机器人。来源:YouTube


创建世界观


然而,LeCun 确实有道理,因为在机器人拥有更完整的人类能力之前,还需要更多的进步。在工厂中移动零件比在动态、复杂的环境中导航要简单。


当前一代机器人面临三个关键挑战:足够快地处理视觉信息以做出实时反应;理解人类行为中的微妙线索;以及适应环境中的意外变化。如今,大多数类人机器人都依赖于云计算,由此产生的网络延迟会使捡起物体等简单任务变得困难。


一家致力于克服当前机器人技术限制的公司是初创公司 World Labs,该公司由“人工智能教母”李飞飞创立。李飞飞在接受《连线》采访时说:“计算机的物理世界是通过摄像头看到的,而摄像头后面的计算机大脑是可见的。将这种愿景转化为推理、生成和最终的交互,涉及理解物理结构,即物理世界的物理动力学。这项技术被称为空间智能。


Gen AI 通过帮助机器人实时绘制周围环境地图来为空间智能提供动力,就像人类一样,预测物体可能如何移动或变化。这些进步对于创建自主人形机器人至关重要,这些机器人能够以成功所需的适应性和决策技能在复杂的现实世界场景中导航。


虽然空间智能依靠实时数据来构建环境的心理地图,但另一种方法是帮助人形机器人从单个静止图像中推断现实世界。正如在一篇预先发表的论文中所解释的那样,Generative World Explorer (GenEx) 使用 AI 从单个图像创建详细的虚拟世界,模拟人类如何对周围环境进行推理。虽然仍处于研究阶段,但此功能将帮助机器人在瞬间做出决策或使用有限的传感器数据导航新环境。这将使它们能够快速理解和适应他们以前从未体验过的空间。


机器人技术的 ChatGPT 时刻即将到来


World Labs 和 GenEx 推动了 AI 推理的界限,而 Nvidia 的 Cosmos 和 GR00T 正在应对为人形机器人配备真实世界适应性和交互能力的挑战。Cosmos 是一系列 AI“世界基础模型”,可帮助机器人理解物理和空间关系,而 GR00T(通才机器人 00 技术)则允许机器人通过观察人类来学习,就像学徒向师傅学习一样。这些技术共同帮助机器人了解该做什么以及如何自然地做。


这些创新反映了机器人行业为人形机器人提供认知和物理适应性的更广泛推动。GR00T 可以通过观察和模仿医疗专业人员使人形机器人能够帮助医疗保健,而 GenEx 可能允许机器人通过从有限的视觉输入推断环境来导航灾区。据《投资者商业日报》报道,英伟达首席执行官黄仁勋表示:“机器人技术的 ChatGPT 时刻即将到来。


另一家致力于创建物理 AI 模型的公司是 Google DeepMind。该公司的研究科学家蒂莫西·布鲁克斯 (Timothy Brooks) 本月在 X 上发帖称,该公司计划制作模拟物理世界的大规模生成模型。


这些新兴的物理世界模型将更好地预测、规划和从经验中学习,这些都是未来类人机器人的基本功能。

20250121111158
Google 正在构建世界仿真模型。来源:X.com


机器人来了


到 2025 年初,人形机器人在很大程度上是原型。在短期内,它们将专注于特定任务,例如制造、物流和灾难响应,在这些任务中,自动化可提供立竿见影的价值。随着技术的成熟,护理或零售互动等更广泛的应用将在以后出现。然而,人工智能和机械工程的进步正在加速此类人形机器人的发展。


咨询公司埃森哲(Accenture)最近注意到,专门为在人类世界中创造机器自主性而构建的全栈机器人硬件、软件和人工智能模型正在开发中。该公司在其“2025 年技术愿景”报告中指出:“在接下来的十年里,我们将开始看到机器人随意而普遍地与人互动,在计划外的任务中进行推理,并在任何类型的环境中独立采取行动。


20250121111249
过去和预计未来机器人采用的时间表。来源:埃森哲 2025 年技术愿景 – 2025 年技术愿景


华尔街公司摩根士丹利估计,到 2040 年,美国人形机器人的数量可能达到 800 万台,到 2050 年可能达到 6300 万台。该公司表示,除了技术进步之外,造成劳动力短缺的长期人口变化可能有助于推动发展和采用。


构建值得信赖的机器人


除了纯粹的技术障碍之外,还必须克服潜在的社会反对意见。如果不解决这些问题,公众的怀疑可能会阻碍人形机器人的采用,即使是在人形机器人提供明显好处的领域也是如此。为了取得成功,部署的人形机器人需要被视为值得信赖,人们需要相信它们有助于社会。正如《麻省理工科技评论》所指出的那样,“如果这样的机器人现在走进他们的客厅,很少有人会感到温暖和舒适。


为了以信任应对挑战,研究人员正在探索如何使机器人看起来更具亲和力。例如,日本的工程师用人类皮肤细胞制造了一种口罩,并将其贴在机器人上。根据去年夏天发表并由《纽约时报》报道的一项研究,该研究的首席研究员说:“类似人类的面孔和表情改善了人机互动中的沟通和同理心,使机器人在医疗保健、服务和陪伴角色中更加有效。”换句话说,类似人类的外表将提高信任度。


除了看起来值得信赖之外,类人机器人还需要始终如一地以合乎道德和负责任的方式行事,以确保人类接受。例如,在公共场所,带有摄像头的人形机器人可能会无意中收集敏感数据,例如对话或面部细节,从而引发对监控的担忧。确保透明数据实践的政策对于减轻这些风险至关重要。


下一个十年


在短期内,人形机器人将专注于特定任务,例如制造、物流和灾难响应,在这些任务中,自动化将提供即时价值。这些专业角色突出了它们在结构化环境中的当前优势,而随着技术的成熟,医疗保健、护理和零售运营等更广泛的应用将出现。


随着类人机器人在日常生活中越来越明显,它们的存在将深刻影响并可能重塑人类互动和社会规范。除了执行任务外,这些机器还将融入社会结构,要求人类与技术建立新的关系。它们的采用可以缓解老龄化社会的劳动力短缺并提高服务部门的效率,但也可能在日益自动化的世界中引发关于工作流失、隐私和人类身份的辩论。为这些转变做准备不仅需要技术进步,还需要深思熟虑的社会适应。


通过应对挑战并利用人形机器人的效率和适应性,我们可以确保这些技术成为推动进步的工具。塑造这个未来不仅是政策制定者和技术领导者的责任,也是每个人的对话。公众参与对于确保人形机器人改善社会和满足人类的实际需求至关重要。



Gary Grossman 是 Edelman 技术实践执行副总裁,也是 Edelman AI 卓越中心的全球负责人。