Pelican-VL 1.0开源发布:全球最强具身多模态大模型问世,引领机器人“大脑”革命

11.14 团队通过先进的数据蒸馏技术,从海量原始数据中提炼出包含数亿token的高质量元数据作为训练基石,为其强大的泛化能力奠定了坚实基础

11月13日北京人形机器人创新中心正式宣布,全面开源其最新研发的具身智能视觉语言模型(VLM)—— Pelican-VL 1.0。此举不仅标志着中国在具身智能领域的重大技术突破,更在全球范围内树立了开源多模态大模型的新标杆。

 

据官方披露,Pelican-VL 1.0同时提供7B和72B两种参数规模版本,是迄今为止“最大规模的开源具身多模态大模型”。在性能方面,该模型表现尤为亮眼:其综合能力超越了包括GPT-5同类模型在内的多个国际顶尖模型,性能提升幅度高达15.79%;与Google的Gemini系列相比,提升更是达到了19.25%。在国内,它也显著优于通义千问(Qwen-VL)、书生万象(InternVL)等主流开源模型,确立了其“目前最强的开源具身多模态大模型”的地位。


2025-11-14_113243_205

 

Pelican-VL 1.0的卓越性能背后,是其强大的技术内核。该模型在由超过1000台A800 GPU组成的高性能计算集群上进行训练,单次关键训练节点的算力消耗就超过了50,000 A800 GPU-小时。团队通过先进的数据蒸馏技术,从海量原始数据中提炼出包含数亿token的高质量元数据作为训练基石,为其强大的泛化能力奠定了坚实基础。

 

尤为引人注目的是,研发团队独创了一套名为DPPO(刻意训练)的全新训练范式。这是全球首个专为具身多模态大模型设计的后训练自进化算法框架。DPPO的引入带来了革命性的效率提升:Pelican-VL 1.0仅用20万(200K)条训练数据就实现了“性能最强”的目标,所需数据量仅为其他同类大模型的1/10乃至1/50,堪称“开源VLM性价比之王”。


2025-11-14_113257_996

 

这一技术突破的意义远不止于模型本身。Pelican-VL 1.0作为机器人的“开源基础脑模型”,成功打通了“感知-推理-动作”的全链路闭环。实际测试表明,搭载该模型的多机器人协作系统成功率已超过64%,甚至能完成抓取鸡蛋等对精细操作要求极高的任务。这预示着它将在商业服务、工业自动化、高危特种作业及家庭服务等多个真实场景中发挥巨大潜力,通过强大的视觉-语言感知能力,辅助机器人完成复杂的多步骤任务规划。

 

值得一提的是,Pelican-VL 1.0的核心主创团队主要由女性技术人员组成,她们的杰出工作不仅推动了技术的前沿,也为人工智能领域的多元化发展树立了榜样。

 

随着Pelican-VL 1.0的全面开源,全球的开发者和研究机构将能够基于这一强大的基础模型进行二次开发和创新,有望极大地加速具身智能技术的商业化落地与生态繁荣,开启通用人工智能(AGI)探索的新篇章。