
腾讯推出了“Hunyuan3D 2.0”,这是一个人工智能系统,可以在几秒钟内将单个图像或文本描述转换为详细的 3D 模型。该系统将通常漫长的过程(可能需要熟练的艺术家数天或数周的时间)转变为快速的自动化任务。
继其前身之后,该模型的新版本在 Hugging Face 和 GitHub 上作为开源项目提供,使世界各地的开发人员和研究人员可以立即使用该技术。
“对于艺术家来说,创建高质量的 3D 资产是一个耗时的过程,这使得自动生成成为研究人员的长期目标,”该公司的研究团队在一份技术报告中写道。升级后的系统建立在其前身的基础上,同时在速度和质量方面引入了显着改进。
Hunyuan3D 2.0 如何将图像转化为 3D 模型
Hunyuan3D 2.0 使用两个主要组件:Hunyuan3D-DiT 创建基本形状,而 Hunyuan3D-Paint 添加表面细节。该系统首先制作一个对象的多个 2D 视图,然后将这些视图构建成一个完整的 3D 模型。新的引导系统确保对象的所有视图都匹配——解决了 AI 生成的 3D 模型中的常见问题。
“我们将相机放置在特定高度,以捕捉每个物体的最大可见区域,”研究人员解释说。这种方法与他们混合不同视点的方法相结合,有助于系统捕捉其他模型经常错过的细节,尤其是物体的顶部和底部。

该图显示了 Hunyuan3D 2.0 如何通过多视图扩散和稀疏视图重建技术将单个熊猫图像转换为 3D 模型。(来源:arxiv.org)
更快、更准确:Hunyuan3D 2.0 的与众不同之处
技术成果令人印象深刻。根据标准的行业测量,Hunyuan3D 2.0 生成的模型比现有系统更准确、更具视觉吸引力。标准版本在大约 25 秒内创建一个完整的 3D 模型,而更小、更快的版本只需 10 秒即可完成。
Hunyuan3D 2.0 的与众不同之处在于它能够处理文本和图像输入,使其比以前的解决方案更加通用。该系统还引入了“自适应无分类器指导”和“混合输入”等创新功能,有助于确保生成的 3D 模型的一致性和细节。
根据他们公布的基准测试,Hunyuan3D 2.0 的 CLIP 分数为 0.809,超过了开源和专有替代方案。该技术在纹理合成和几何精度方面引入了显着改进,在所有标准行业指标上都优于现有解决方案。
该系统的关键技术进步是它能够在不需要大量计算能力的情况下创建高分辨率模型。该团队开发了一种新方法,可以在保持处理需求可控的同时增加细节——这是其他 3D AI 系统的常见限制。
将 3D 建模工具引入更多行业
这些进步对许多行业都很重要。游戏开发人员可以快速创建角色和环境的测试版本。在线商店可以 3D 形式展示产品。电影制片厂可以更高效地预览特效。
腾讯通过 Hugging Face 共享了其系统的几乎所有部分。开发人员现在可以使用该代码创建与标准设计软件配合使用的 3D 模型,使其在专业环境中立即使用。
虽然这项技术标志着自动化 3D 创作向前迈出了重要一步,但它也引发了关于艺术家未来将如何工作的问题。腾讯认为 Hunyuan3D 2.0 不是人类艺术家的替代品,而是作为一种工具,可以在创作者专注于艺术决策时处理技术任务。
随着 3D 内容在游戏、购物和娱乐中越来越重要,像 Hunyuan3D 2.0 这样的工具预示着一个未来,创建虚拟世界就像描述它们一样简单。未来的挑战可能不是生成 3D 模型,而是决定如何处理它们。