倒计时18天:中国具身智能迎来“入户大考”,一场从实验室到客厅的极限穿越

5.8 在真实数据采集中,采用人类动作捕捉是常见方式数据采集员穿戴动作捕捉设备,力触觉传感器音视频传感器自动收集数据

2026050805


5月7日,距离深圳一家具身智能企业宣布的“首批机器人进家庭”节点,还有18天。

在此之前,首届广东省人工智能应用对接大会刚刚落幕,华为昇腾、腾讯混元等AI成果集中亮相。而更早一周,该企业发布了全球首个基于世界统一模型架构(WUM)的具身智能大模型,并宣布其新一代机器人将于5月25日正式入户。

家庭场景,被业内称为具身智能的“终极考场”。这一考题的启动时间已从行业普遍预期的5至10年,骤然压缩至“当月”。这究竟是一家企业的技术突围,还是整个产业链系统性优势的集中释放?


一、“终极考场”为何是家庭?

具身智能进家庭,第一个拦路虎并非算法,而是数据。

“当前行业已逐渐摆脱‘缺数据’的处境,但进入了‘缺好数据’的阶段。”深圳市人工智能与机器人研究院研究员、极数迭代CTO夏轩向《华夏时报》记者指出了核心症结。他解释,这源自三个底层瓶颈:

数据维度上,需要专业、长时间、多场景的“纵向数据”,而当前多为非专业、短时间、单任务的“横向切片”;

隐私约束上,家庭数据无法像互联网数据那样大规模汇聚。家庭是私人空间,数据获取的门槛不在技术,而在信任与制度;

评估标准上,缺乏针对家庭服务机器人的评测基准,学术界仍在用工厂指标衡量家庭场景。

这一问题在学术研究中同样得到印证。一项发表于《Futures》期刊的研究提出了AI人形机器人家庭接受的“洋葱模型”,将接受度分为三个层次:技术层(系统可靠性、易用性)、心理层(个性化、成本收益评估)、社会层(同伴影响)。研究发现,感知侵入性会显著抑制接受意愿,这反映了家庭环境中对隐私的高度敏感性。

这意味着,机器人进家庭不仅要“会干活”,还要“被信任”。


二、广东产业链的“密、快、狠”解法

如何破解这一困局?深圳南山的产业链密度提供了独特解法。

夏轩用 “密、快、狠” 三个字概括了南山生态的优势,并强调这解决的是数据“谁来采、怎么采、采完怎么用”的全链条问题。

“密”——产业链密度大幅降低了试错成本。多家机器人企业与科研机构集中在半小时车程内,“一个数据采集需求,从提出到验证,两天就能跑通”。这种密度让“小步快跑”成为可能,而数据工程最忌讳的恰恰是“大步慢走”。在深圳南山“机器人谷”,10公里半径内已聚集200余家全产业链企业,从传感器、AI大模型到整机,不出谷就能找齐。

“快”——硬件供应链支撑多样化采集方案。从相机模组、电机到深度传感器,上游企业的集聚让采集设备的定制成本大幅下降。

“狠”——算力与大模型的协同。华为昇腾、腾讯混元提供底层算力,采集的数据可以就近上云、就近训练、就近部署。“这种地理上的压缩,本质上是迭代周期的压缩。”夏轩说。

国研新经济研究院创始院长、智能经济首席专家朱克力对《华夏时报》记者表示:“这不是偶然事件,而是技术成熟度、产业配套与市场需求三重共振的必然结果。这是产业拐点的标志性事件,是中国硬科技从跟跑到并跑、部分领跑的缩影。”


三、模型进化:从VLA到WUM,让机器人拥有“物理常识”

如果说数据是燃料,那么模型就是引擎。此次引发行业关注的WUM架构,核心是从VLA(视觉-语言-动作)架构向世界统一模型的跨越。这一转变,折射出整个行业对“物理理解能力”的迫切需求。

自变量机器人CEO王潜向南都记者介绍了核心技术突破:“真正的智能机器人难点不在于单一动作的重复,而在于能不能在随机环境下做出全新的、没有被训练过的动作。Wall-B不是一个只会背标准答案的大脑。它包括三方面能力:一是感知和理解,代替死记硬背;二是举一反三,不是每个动作都需要‘老师’教;三是实时调整,做错后可以马上纠正。”

目前,搭载Wall-B模型的机器人保洁员已先后在深圳、北京等地累计服务近百个家庭。在一次真实家庭服务中,机器人第一次遇到一个底部带有吸盘的杯垫。它没有经过专门训练,但通过视觉识别和物理推理,意识到需要稍微用力才能拿起杯子。这种“现场推理”能力,正是WUM区别于传统VLA模型的关键所在。

夏轩将“跑酷”(预设轨迹)与“干活”(真实适应)之间的差距,概括为三个鸿沟:确定性、泛化性、容错性。“跑酷是开环控制,摔了重来。干活是闭环适应——环境在变、物体在动、人在干扰,每一步都要调整。这要求机器人具备世界模型,即对物理因果的理解能力。”


四、隐私与安全:入户的“信任门槛”

一旦机器人进入家庭,用户隐私保护问题不可回避。自变量创始人兼CEO王潜称,自变量会在设备端对原始图像进行实时打码处理,机器人看到的是去除个人特征的场景数据。同时,建立明确的授权机制,只有当用户主动按下同意键后方可开机。

合规层面,具身智能面临与通用AI不同的挑战。具身智能需要收集物理世界中的多模态训练数据,数据来源包括仿真合成数据、真实数据和互联网数据。在真实数据采集中,采用人类动作捕捉是常见方式——数据采集员穿戴动作捕捉设备,力触觉传感器、音视频传感器自动收集数据。这一过程中,知识产权、个人信息与隐私保护问题不容忽视。

天津市网信办去年底推出的“数字风洞”具身智能原生安全解决方案,从智能度、安全度、匹配度、一致性四个维度构建了覆盖全生命周期的评估体系。其中安全度维度针对控制权被劫持或被恶意利用等风险,构建全栈式攻防验证体系,从硬件端口、操作系统到云端应用进行穿透式安全评估。


五、为什么是现在?政策、资本、市场三重共振

这场“入户大考”的启动并非偶然,而是多重力量共同作用的结果。

政策端:就在不久前,国家电网印发《2026年具身智能发展规划》,计划今年集中采购各类具身智能设备约8500台,总投资约68亿元。若计入南方电网及地方能源集团跟进采购,业内预计2026年电力行业具身智能总投资规模有望突破100亿元。

资本端:自变量机器人近期完成B轮融资,由小米战投领投。此前,公司已先后获得字节跳动、美团、阿里巴巴等互联网巨头的战略投资,成为国内唯一一家同时获得四家互联网大厂投资的具身智能企业。资本的强力背书为大规模数据采集提供了资金支撑。

市场端:全球首个机器人保洁员已“上岗”,采用“保洁阿姨+机器人”的人机协同模式。单次服务为3小时,已在深圳、北京开放预约,未来将逐步推广至全国更多城市。


六、18天后的“极限测试”意味着什么?

距离5月25日还有18天。第一批家庭机器人将敲开志愿者的家门。它们是会成为家庭期待的“新成员”,还是暴露更多“实习生”级别的笨拙?

答案尚未可知。王潜不讳言机器人的不成熟,现阶段将其定位为“实习生”。“当大家对机器人的期望不是特别高,机器人进入家庭就能给你很多惊喜;如果以一个人的智能标准去衡量一台机器人,你可能就会对它比较失望。”

自变量联合创始人兼CTO王昊向南都记者表示,行业内大多数训练模型的数据来自实验室:固定光照、固定物体位置、无干扰环境。但这一环境与真实世界有着显著差距,尤其与家庭中随时变化的自然光、随意摆放的物品、孩子和宠物的随机动作截然不同。在实验室里表现优异的模型,一旦面对真实家庭的“混乱”,准确率可能从90%骤降到60%以下。

但可以确定的是,批量真实家庭入户的价值远大于单次舞台展示。“意味着从炫技走向实用,直接教育消费者,对行业商业化的全面提速意义重大。”艾媒咨询CEO兼首席分析师张毅这样评价。

夏轩在采访最后给行业留下一段值得深思的话:“家庭场景的复杂性、隐私约束、安全要求,是任何生态都无法替代的‘硬骨头’。不要低估‘从能用到好用’的距离。机器人进家庭,不是技术的终点,而是数据工程、伦理治理、商业模式综合考量的起点。”


点评

18天后敲开家门的,不是成熟产品的亮相,而是一场真实环境下的“极限测试”。

这是全球范围内具身智能首次面向真实家庭环境的大规模入户测试,其意义不亚于自动驾驶的“路测牌照”。无论结果如何,这道“终极考题”已经开卷,而广东的产业链正在为这场考试提供着独一无二的支撑——从“机器人谷”的产业集群,到小米、字节、美团等资本的重仓押注,再到政策端的百亿级采购信号。

但正如夏轩所言,真正的挑战不在技术本身,而在技术之外。当机器人走进客厅,它面对的不仅是杂物和宠物,更是人类对“信任”和“隐私”的复杂期待。这场考试的答卷,将决定具身智能是停留在“赛博店员”的炫技阶段,还是真正开启“走进千家万户”的新纪元。

我们拭目以待。