智源发布Emu3.5大模型:AI开始“动手”,如何让大模型从旁观者变成行动者?

10.30 Emu3.5首次将下一状态预测Next-StatePredictionNSP作为核心架构,把文本图像动作甚至环境反馈统统编码为一个连续的状态序列,让模型像人类一样,通过预测接下来会发生什么来决定现在该做什么

2025-10-30_205443_620


在大多数人的印象里,多模态大模型的“聪明”体现在能看图说话、文生图、甚至生成短视频。但10月30日北京智源人工智能研究院发布的悟界·Emu3.5,却试图打破这一边界——它不再满足于“描述世界”,而是要“操作世界”。

 

这不是一次常规的模型迭代。Emu3.5首次将“下一状态预测”(Next-State Prediction, NSP)作为核心架构,把文本、图像、动作甚至环境反馈统统编码为一个连续的状态序列,让模型像人类一样,通过预测“接下来会发生什么”来决定“现在该做什么”。这种机制,让AI从被动响应的“语言翻译器”,转变为具备主动规划能力的“智能体”。

 

从“看图说话”到“动手改图” 

传统多模态模型面对“把咖啡杯移到桌子右边并调亮色调”这类指令,往往只能生成一张新图,无法保证操作的连贯性或物理合理性。而Emu3.5则能分步推理:先识别对象与空间关系,再模拟移动后的光照变化,最终输出符合视觉逻辑的结果。这种能力被称为“具身操作”——即模型在虚拟或现实环境中具备“身体感”和行动力。

 

实测显示,Emu3.5不仅能根据“赛博朋克雨夜街道”的文字生成高细节图像,还能对已有视频进行动态干预,比如让奔跑的角色突然停下、转身,动作流畅且符合物理规律。更令人惊讶的是,它支持语义级编辑,用户只需说“换成复古西装”,无需圈选区域,模型便能精准替换服装风格并保持光影一致。

 

为什么“预测下一步”如此关键? 

NSP的本质,是让AI学习世界的演化规律。就像婴儿通过不断尝试和观察来理解“推倒积木会塌”,Emu3.5通过海量多模态序列(据称训练数据超10万亿token)学习“输入—动作—结果”之间的因果链条。这种训练方式,使其在未见过的场景中也能泛化出合理行为,为机器人控制、自动驾驶、虚拟助手等需要闭环决策的领域打开新可能。

 

不只是技术突破,更是范式迁移 

过去,多模态模型常被诟病“模态割裂”——图像和文本各自编码,再强行对齐。而Emu3.5将所有模态统一为可预测的状态流,实现了真正的跨模态协同推理。这意味着,未来用户或许只需用自然语言指挥AI完成从设计海报、剪辑视频到操控机械臂的一系列任务,无需切换工具或掌握专业技能。

 

智源研究院透露,Emu3.5将率先落地于教育(如自动生成互动课件)、医疗(融合影像与病历的多模态诊断)和娱乐(AI导演系统)等场景,并计划开源部分能力以推动生态建设。

 

结语:AI的“手”终于长出来了 

如果说GPT教会了AI“说话”,Stable Diffusion教会了它“画画”,那么Emu3.5正在赋予它“动手”的能力。当大模型不再只是世界的观察者,而是能参与其中、改变其中的行动者,通用人工智能的轮廓或许正变得清晰起来。而这一切,始于一个朴素却深刻的信念:理解世界,不如学会预测它下一步的样子。