12月18日,在空间计算与生成式AI交汇的浪潮中,苹果公司再次投下重磅技术。近日,苹果开源了一款名为SHARP(Sharp Monocular View Synthesis in Less Than a Second)的AI模型,该模型能够仅凭一张普通的2D照片,在不到一秒钟内生成具有真实物理尺度的高质量3D场景,为AR/VR、移动端内容创作乃至未来“空间互联网”应用打开了新的大门。
从“图像”到“空间”:技术原理揭秘
SHARP的核心在于其对3D高斯泼溅(3D Gaussian Splatting)技术的创新性应用。传统3D重建往往依赖数十乃至上百张多视角图像,并通过耗时数分钟至数小时的优化过程来恢复场景几何。而SHARP通过在海量合成与真实数据上进行预训练,让神经网络掌握了通用的深度和几何先验知识。
当用户输入一张新照片时,SHARP仅需一次神经网络前向传播,即可直接预测出超过百万个3D高斯球(即带有颜色、位置、协方差等属性的“光团”)的参数,从而瞬间构建出可交互的3D表示。这一过程在标准GPU上耗时不足一秒,相较传统方法提速三个数量级。

质量与效率双突破
在追求速度的同时,SHARP并未牺牲视觉保真度。根据其官方论文《一秒内实现清晰的单目视图合成》(Sharp Monocular View Synthesis in Less Than a Second),该模型在多个公开基准测试中大幅领先现有方法:
LPIPS(感知图像相似度)指标降低25%至34%;
DISTS(纹理结构相似度)指标降低21%至43%。
这意味着SHARP生成的3D视图不仅结构准确、纹理锐利,还能支持真实相机运动模拟,为用户提供沉浸式的6自由度(6DoF)体验。
理性边界:不“脑补”盲区
值得注意的是,SHARP遵循“所见即所建”的原则。为确保物理合理性与生成稳定性,模型不会凭空生成照片中完全被遮挡的区域,其有效视角被限定在原始拍摄位置的邻近范围内。这一设计虽限制了全局重建能力,却极大提升了结果的真实性和计算效率,特别适合移动端AR、空间照片浏览等近视角应用场景。
开源赋能,加速生态演进
目前,苹果已将SHARP的完整代码、预训练模型及使用文档开源至GitHub平台,供全球开发者与研究者免费使用和二次开发。此举被视为苹果在空间计算领域“软硬协同”战略的重要一环,有望显著推动轻量化3D内容生成、AR眼镜应用、虚拟试穿/试住等消费级场景的普及。
在SHARP之外,苹果近期还发布了Depth Pro等系列单目深度估计模型,显示出其在单图3D理解方向的系统性布局。随着这些技术的成熟与融合,未来用户或将仅凭手机随手一拍,即可进入一个可探索、可交互的3D数字世界——而这一切,只需一秒钟。
论文:https://arxiv.org/abs/2512.10685
