2025年6月6日,北京智源人工智能研究院在第七届北京智源大会上重磅发布了"悟界"系列大模型,标志着我国在物理通用人工智能(AGI)领域取得重大突破。该系列包含五大核心模型,构建了从世界理解、脑科学融合到具身控制和微观生命模拟的全链条AI体系。

原生多模态世界模型Emu3:统一文本、图像与视频理解生成
Emu3是智源于2024年10月率先推出的原生多模态世界模型,采用创新的自回归架构统一多模态学习。该模型通过新型视觉tokenizer将图像/视频编码为与文本同构的离散符号序列,构建了模态无关的统一表征空间。Emu3无需依赖扩散模型或组合架构,在单一框架内即可完成文本、图像、视频的任意组合理解与生成,支持多模态输入输出的端到端映射。
性能方面,Emu3在图像生成任务中优于Stable Diffusion 1.5与SDXL模型;在视觉语言理解任务中,12项基准测试平均得分超越LlaVA-1.6;在视频生成任务中,VBench基准测试得分超过OpenSora 1.2。这一突破验证了自回归框架在多模态领域的普适性,为跨模态交互提供了强大技术基座。

Emu3 生成的图像
脑科学多模态通用基础模型见微Brainμ:神经科学领域的"AlphaFold"
基于Emu3底层架构,见微Brainμ首次实现了脑科学信号(如fMRI、EEG、双光子成像)的token化与多模态对齐。该模型已完成超过100万神经信号单元的预训练,被誉为神经科学领域的"AlphaFold"。
Brainμ具备跨任务、跨模态、跨个体的统一建模能力,可同步处理多类编解码任务,兼容多物种动物模型(小鼠、狨猴、猕猴)与人类数据。在自动化睡眠分型、感官信号重建与多种脑疾病诊断等任务中,其作为单一模型性能显著超越现有专有模型。在与强脑科技BrainCO的合作中,Brainμ首次在便携式消费级脑电系统上实现了感觉信号重建,展现了在脑机接口应用中的潜力。
具身智能双突破:RoboOS 2.0与RoboBrain 2.0
RoboOS 2.0**是全球首个支持MCP(多本体协同平台)机制的跨本体具身大小脑协作框架,实现了无服务器一站式轻量化机器人本体部署。该系统新增多本体时空记忆场景图(Scene Graph)共享机制,支持动态环境下的实时感知与建模,整体性能提升30%,全链路平均响应时延低于3ms,端云通信效率提升27倍。
RoboBrain 2.0是目前全球最强的开源具身大脑大模型,在任务规划准确率上较1.0版本提升74%,新增了空间推理能力和闭环反馈机制。该模型实现了基于多本体-环境动态建模的多机协同规划能力,可实时构建包含本体定位的场景图,并自动完成跨本体任务分配。在空间智能方面,其可操作区域感知与操作轨迹生成能力提升17%,新增对复杂空间的多步推理能力。
全原子微观生命模型OpenComplex2:原子级生命模拟
OpenComplex2实现了生物分子研究从静态结构预测到动态构象分布建模的重大突破。该模型能够表征生物分子系统的连续演化能量景观,在原子分辨率层面捕捉分子相互作用及平衡构象分布。
基于FloydNetwork图扩散框架及多尺度原子精度表示两大技术创新,OpenComplex2有效突破了动态构象分布预测瓶颈,可同时捕捉原子级、残基级和基序级的相关性。在生物分子动态特性预测、柔性系统及超大型复合物建模等任务中表现卓越,将新药筛选周期缩短40%,为生物医药行业带来革命性工具。
构建通向物理AGI的全链条技术体系
"悟界"系列的"界"字寓意突破虚实边界,迈向物理世界的深度理解与交互。通过Emu3对世界的统一表征、Brainμ对脑信号数据的建模、RoboBrain对行动的规划、OpenComplex对微观世界的洞察,智源系统性地勾勒出通向物理AGI的技术路径。
目前,智源已与北京大学、清华大学、复旦大学、北京生命科学研究所等科研机构,以及全球20多家具身智能企业建立合作,共同推动"悟界"系列模型的科研与产业落地。所有模型均已全面开源,包括框架代码、模型权重、数据集与评测基准,以促进AI社区的共同进步。