腾讯混元团队今日正式发布其世界模型系列的最新版本:混元世界模型1.5(Tencent HY WorldPlay)。与以往仅能生成静态图像或短视频的AI不同,WorldPlay首次实现了用户可**实时漫游、交互并“记住”空间结构**的AI生成3D世界,标志着AI内容生成从“片段式”迈向“持续性世界”的关键转折。

实时性×几何一致性的双重突破
WorldPlay的核心突破在于解决了当前生成式AI在实时渲染与长时空间一致性之间的矛盾。模型采用自回归扩散架构,通过“Next-Frames-Prediction”视觉预测任务进行训练,支持以24帧/秒的流畅速率生成720P高清视频流。更重要的是,它引入了“重构记忆机制(Reconstituted Memory)”,使得用户离开某一区域后返回时,场景能精准还原其三维结构——这一能力在AI驱动的虚拟世界构建中尚属首例。

全链路开源,推动行业共建
腾讯此次不仅发布了模型,更**首次开源了业界最系统、最全面的实时世界模型训练体系**,覆盖从数据采集、模型预训练、强化学习后训练到流式推理部署的完整链路。技术报告中详述了包括上下文对齐蒸馏(Context Forcing)、双分支动作表征控制、基于3D奖励的强化学习框架等原创模块。
开发者可通过以下渠道获取资源:
Hugging Face模型库:https://huggingface.co/tencent/HY-WorldPlay
在线体验平台:https://3d.hunyuan.tencent.com/sceneTo3D?tab=worldplay
从1.0到1.5:混元世界模型的快速演进
混元世界模型的迭代速度令人瞩目:
2025年7月,1.0版本在世界人工智能大会(WAIC)发布,支持文本或单图生成兼容图形管线的可漫游3D场景;
10月,1.1版本升级,新增多视图与视频输入能力,实现“一键重建3D世界”;
仅两个月后,1.5版本便带来实时交互、空间记忆与流式生成能力,完成从“生成”到“构建”的跃迁。
应用场景多元,赋能创意与科研
WorldPlay的潜力远超娱乐。在AI游戏开发中,它可作为智能关卡生成器,根据玩家指令实时构建可探索世界;在影视与VR制作中,创作者能快速预览和迭代场景设计;而在具身智能(Embodied AI)研究领域,它为智能体提供高保真、可交互的训练沙盒,加速感知-决策-行动闭环的验证。
更值得称道的是,生成的3D场景可导出为点云数据,直接接入Unity、Unreal等主流引擎,打通AI生成内容与工业管线的“最后一公里”。
未来已来:AI不只是生成内容,而是创造世界
腾讯混元团队表示,WorldPlay代表了“AI生成内容”(AIGC)的下一阶段——AI Worlds as a Service(AI世界即服务)。未来的AI不再是被动响应指令的工具,而是能主动生成、维护并演化一个逻辑自洽、视觉连贯、可长期交互的“数字宇宙”。
正如一位业内专家所言:“当AI开始‘记住’你去过的地方,它就不再只是幻觉制造机,而成了世界的建筑师。”