2025年7月26日,上海世博中心迎来了本年度最具影响力的科技盛会之一——世界人工智能大会(WAIC)。在这场汇聚全球顶尖科技企业与行业领袖的展会上,华为首次线下展出的昇腾384超节点Atlas 900 A3 SuperPoD成为全场焦点,并获评大会“镇馆之宝”。这一突破性产品的发布,不仅标志着中国企业在高性能AI计算领域的重大进步,更预示着全球人工智能算力竞争进入以“超互联、低时延”为核心的新阶段。

华为此次展示的昇腾超节点架构,通过创新总线技术实现了384个NPU(神经网络处理器)之间的大带宽、低时延互联,有效解决了大规模AI集群中计算与存储资源之间的通信瓶颈。相比传统架构,其超节点内任意两个AI处理器之间的通信带宽提升了15倍,单跳时延降低了10倍。这一技术突破对于当前依赖万卡级集群训练的大模型研发至关重要,尤其是在处理千亿级参数模型时,能够显著减少因通信延迟导致的算力浪费。
更引人注目的是,昇腾超节点支持全局内存统一编址,并采用指令级内存语义通信技术,使其在实时AI任务中展现出极低的响应延迟。据华为官方数据,该方案是业界唯一能够将Decode时延控制在15毫秒以内的解决方案,可满足自动驾驶、实时交互AI等对延迟极为敏感的应用场景需求。在实际测试中,昇腾超节点在LLaMA3等千亿参数稠密模型训练中的性能可达传统集群的2.5倍以上,而在通信需求更高的混合专家模型(MoE)和多模态模型(如Qwen、DeepSeek)上,性能提升甚至超过3倍。
这一技术突破无疑将对全球AI算力格局产生深远影响。目前,美国企业如英伟达(NVIDIA)仍依赖其NVLink和InfiniBand技术构建AI超级计算集群,虽然在单卡算力上保持领先,但随着模型规模的爆炸式增长,集群通信效率逐渐成为制约算力扩展的关键瓶颈。华为的超节点架构通过优化NPU间直接互联,为更大规模的AI训练任务提供了新的解决方案,尤其适合中国正在推进的“东数西算”等分布式计算项目。
国际科技媒体和行业专家对此反应强烈。《麻省理工科技评论》评论称,中国AI硬件正从“替代者”逐渐转变为“创新者”,华为的超节点技术可能迫使西方国家重新评估对华技术封锁的实际效果。东京大学AI研究所的田中健一教授指出,低时延通信是下一代AI集群的关键技术,但华为仍需证明其方案在不同硬件生态中的兼容性。与此同时,硅谷知名风险投资人Sarah Guo在社交媒体上表示,如果华为的性能数据得到独立验证,云计算厂商可能会重新评估其采购策略,因为总拥有成本(TCO)而不仅仅是政治因素,将成为决策的重要依据。
然而,华为也面临诸多挑战。尽管昇腾系列芯片在算力上取得了显著进步,但全球AI开发生态仍然高度依赖英伟达的CUDA平台,PyTorch和TensorFlow等主流框架对昇腾的优化仍显不足。此外,在国际市场上,部分客户对华为产品的数据安全性和长期技术支持仍存疑虑。另一个未明确解答的问题是能效比——在大模型训练日益强调绿色计算的背景下,昇腾超节点的功耗表现尚未公开,这可能影响其在环保政策严格地区的市场推广。
世界人工智能大会历来是观察全球AI技术趋势的重要窗口。今年,华为昇腾超节点的亮相不仅展示了中国企业在AI基础设施领域的快速进步,也折射出全球算力竞赛的新动向:美国企业继续引领单卡性能,而中国正试图通过集群架构创新实现弯道超车。与此同时,欧盟和日本也在加大AI基础设施投资,试图在未来的技术版图中占据一席之地。这场竞赛的结果,将深刻影响未来五年全球人工智能创新的主导权分配。
随着大会的进行,更多细节或许会浮出水面。但可以确定的是,AI算力的竞争已不再局限于芯片本身,而是扩展到整个计算架构、通信效率和生态协同的全面较量。华为的这次展示,无疑为这场竞赛增添了新的变数。