腾讯于近日正式发布并开源了其混元世界模型1.1(WorldMirror),该版本在3D重建领域实现了显著突破,标志着这项技术正加速走向普及化与实用化。

作为对今年7月发布的业界首个兼容传统CG管线的开源可漫游世界生成模型——混元世界模型1.0的全面升级,新版本1.1的核心亮点在于其“端到端”和“统一”的特性。它不仅是业界首个统一的前馈式(feedforward)3D重建大模型,更首次实现了从多视图图像或视频到完整3D世界的“一键生成”。

混元世界模型1.1通过引入多模态先验引导机制,显著提升了重建的灵活性与精度。该模型支持动态注入相机位姿、内参、深度图等多种先验信息,确保生成的3D场景在几何结构上高度准确。在此基础上,它采用了一个通用的几何预测架构,能够在一个统一的框架内同步输出点云、深度图、相机参数、表面法线以及新视角合成图像等多种3D资产,展现出卓越的综合性能。
在效率方面,该模型的表现尤为突出。得益于其纯前馈架构,模型能在单次推理中直接输出所有3D属性,对于典型的8-32视图输入,整个过程仅需约1秒钟,真正满足了实时应用的需求。同时,模型支持单卡部署,大幅降低了使用门槛,使得消费级硬件也能运行这一先进技术。
目前,混元世界模型1.1已在GitHub上完全开源,开发者可轻松克隆仓库并根据文档进行本地部署。对于普通用户,腾讯也提供了便捷的在线体验入口,通过HuggingFace Space平台,用户只需上传多视图图像或视频,即可实时预览生成的高质量3D场景。这一系列举措,无疑将有力推动3D内容生成在虚拟现实、游戏开发、数字孪生等领域的广泛应用。
项目:
https://3d-models.hunyuan.tencent.com/world/
https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirro
https://huggingface.co/tencent/HunyuanWorld-Mirror