人工智能工厂:未来的数据中心

10.27 人工智能工厂正在将传统数据中心模型从稳定的成本中心转变为增长引擎,加速计算将推动未来十年及以后的曲线

我们所知道的数据中心正在被重新构想为“人工智能工厂”——一个电力和数据优化的工厂,在工业规模上将能源和信息转化为智能。

 

技术堆栈正在从以通用中央处理器为中心的系统转向以图形处理单元为中心的加速计算,针对并行作进行了优化,专为人工智能而构建。网络结构对于这一转变至关重要,其支持元素包括分解存储、受监管的数据平面以及从以应用程序为中心的作到协调模型、工具和流程工作流程的智能代理控制平面的转变。简而言之,对通用计算的投资正在迅速转向极端并行性、纵向扩展/横向扩展/横向扩展网络,以及为大规模 AI 吞吐量构建的自动化数据治理。

 

在这篇突发分析中,我们深入研究了人工智能工厂的关键方面。在本研究报告中,我们将:


  • 定义 AI 工厂

  • 解释为什么现在以及正在发生的结构性转变

  • 提出AI工厂的参考架构

  • 深入到网络

  • 预测和细分市场,查看人工智能工厂建设支出与代币生成和其他人工智能服务等活动的收入输出之间的差距

  • 简单谈谈AI工厂的经济学

  • 探索协议和互作性要求

  • 评估开发人员的影响

  • 最后,我们看到在这个新时代争夺统治地位的一些球员的简要观察。

 

什么是“人工智能工厂”?

TheCUBE Research 将 AI 工厂定义为专门用于 AI 生产的系统。它的工作是通过自动化的端到端流程将原始数据转换为多功能的人工智能输出,例如文本、图像、代码、视频和令牌。这些流程集成了数据管道、模型训练、推理、部署、监控和持续改进,因此可以大规模生成智能。

 

sjgc011

 

在定义中,我们强调“多功能输出”,因为工厂跨越了多种模式,而不仅仅是令牌生成。输出是智能,我们希望定义能够反映经得起时间考验的更广泛的结果。我们定义的范围超出了硬件范围,涵盖了编排人工智能优化工作负载的技术框架和从业者架构的工作流程。

 

简而言之,人工智能工厂是大型的专业计算工厂,旨在不断创造智能,并在环路中内置质量和安全门。

 

AI工厂参考架构:数据进,智能出

下图显示了 AI 工厂如何将原始数据转换为智能的流程。想想电力流入、数据流经系统以及结果流出。


sjgc02 


工作负载特定于 AI,并在加速的大规模并行基础结构上运行。该流遵循一个自动化过程,该流程使用 AI 管道→训练/试验(你只看一次等)→推理→部署→监视→持续改进。如今,这是使用 TensorFlow、PyTorch、容器和标准容器构建的,但这些原语将从最终用户甚至开发人员那里抽象出来。

 

我们的观点是,大多数企业不会自己建立这些工厂,除非他们打算成为竞争代币和其他人工智能收入的运营商。相反,他们将使用由 OpenAI、Anthropic PBC、其他人工智能实验室和云参与者等公司构建的应用程序编程接口和软件。如上所示,投资回报率将体现在各种行业用例中,包括:大型语言模型训练、计算机视觉、低延迟的实时欺诈检测、推荐引擎、医疗保健决策支持等。该值是由管道启用的实时输出。

 

关键要点:工厂架构很复杂。今天,每个人工智能工厂都是一个定制系统,而且情况可能永远如此。我们目前的想法是,企业人工智能将通过 API 和连接器访问大型人工智能工厂来采用,其软件层隐藏了底层原语和工具的复杂性。

 

工作方式的改变

我们相信,这种基础设施支持业务的深刻变革,即软件即服务或 SaaS 的模型演变为服务即软件或 SaSo,这意味着代理驱动的服务将在有限的人工干预下交付(仍然是人类在循环中),以推动巨大的生产力提升。

 

例如,想象一个由人工智能驱动的自主财务顾问。在这种服务即软件模型中,客户只需将其财务数据和目标直接提供给智能代理即可。该代理使用机器学习即时分析数据,结合实时市场变化、税法变化和客户的风险状况,完全自行生成和执行投资决策或财务计划。

 

人工顾问将被从流程中删除,直到并且除非客户需要额外的人工建议。一个重要的细微差别是,客户不为软件本身付费,而只为交付的结果付费——例如优化的投资组合回报或成功管理的退休基金。

 

关键点:这改变了财富管理业务的运作方式。所有行业都有数以千计的例子将受到这些变化的影响。

 

堆栈翻转:从传统数据中心到AI工厂

下图旨在描述基础设施和软件中发生的板块构造变化。ChatGPT 推出后,重心从以应用程序为中心的数据中心转移到制造智能的人工智能工厂。


sjgc03 


传统的堆栈是从应用程序自上而下构建的,然后开发基础设施来支持应用程序。未来,基础设施和软件将更加灵活,能够支持为特定目的而构建但更具延展性的流程。想想流程乐高积木,它们不是静态和僵化的,而是可以近乎实时地开发以适应特定的业务目标。

 

堆栈的每一层都在重建,以制造智能,而不仅仅是主机应用程序。

 

以下几点简要描述了我们在堆栈中看到的一些变化:

  • 计算:AI 工厂建立在具有极端并行性的加速计算之上。设计将大型模型的纵向扩展节点与吞吐量的横向扩展群集混合在一起,拼接到横向扩展池中以实现弹性。调度器管理 GPU 利用率、内存带宽和互连饱和度,管理超越了传统的 CPU 内核。

  • 联网:结构优先考虑高带宽、超低延迟和避免丢失。自适应路由、拥塞控制、服务质量和拓扑感知等功能针对训练和高速突发流中的集体作进行了调整,以支持推理。交通从北到南、从东到西和从东海岸到西海岸。网络在某种程度上被视为计算的一部分。

  • 存储:默认情况下是分解的。高性能 I/O 使用 NVMe 和并行文件系统进行检查点和分片读取。不太活跃的层使用更便宜的对象存储来处理数据集、模型和工件;存档层保留世系和快照版本。超高性能数据移动器对数据进行预取和暂存,让 GPU 忙于处理小文件和元数据,以保持数据流动。

  • 数据堆栈 (SoI):在基础设施之上,有一个智能系统或 SoI,它模拟了商业状态。它将数据、元数据、特征、向量和过程协调成知识图谱(或等效的知识图谱);跟踪血统和质量;并为训练和推理提供策略感知的上下文。这就是感知、因果关系和目标被编码的“高价值房地产”。

  • 治理(自动化):策略馈送到管理访问、保留、隐私和审计跟踪的运行时控制中。可观测性监控数据、模型访问、来源、提示、工具调用和性能,从而实现调整、回滚和持续测试。

  • 代理控制框架:控制平面对工具/作进行编目、路由任务、实施护栏、管理人机交互并支持变更管理。它将代理视为具有版本控制、服务级别协议和反馈循环的车队,这些循环与 SoI 相关联;并以自上而下的组织关键绩效指标为指导。

  • 关键要点:大多数企业不一定会端到端地建造这些工厂;他们将通过 API 使用他们的服务,同时将结果集成到现有的信息技术中。无论如何,我们相信堆栈正在从以应用程序为中心的成本中心转变为通过 API 访问的情报工厂——企业插入其中以取得成果的独立工厂。

 

网络的关键作用

下面的幻灯片将网络分为三个维度——纵向扩展、横向扩展和横向扩展——因为如果没有带宽、确定性和每一层的低延迟,人工智能工厂就无法工作。


sjgc04 


网络是仅次于 GPU 的第二大支柱

  • 纵向扩展(在机箱内):节点内加速专注于原始 GPU 性能和超低延迟。NVLink/NVSwitch 和 PCIe Gen6 等技术为前沿训练和其他对延迟敏感的工作负载创建了高带宽结构。

  • 横向扩展(在工厂内):在数据中心内互连数十到数十万个 GPU 节点。以太网和 InfiniBand 占据主导地位,供应商(Cisco、Arista、HPE、Juniper、Nvidia)使用 RoCE v2、VXLAN EVPN 和丰富的遥测技术提供经过 AI 调优的结构。最近的芯片(例如,Broadcom Tomahawk 6、Thor Ultra 800G NIC)将集群推向 100,000-XPU 范围。

  • 跨规模(工厂之间):将多个 AI 站点/区域绑定到一个统一的结构中,以实现联合学习、跨区域推理和数据主权 AI,同时跨位置分散电力需求。Nvidia、Cisco、Arista 和新进入者(例如 LumaLens)正在竞相提供安全、确定性、低延迟的工厂间链接。


关键要点:纵向扩展支持最高性能,横向扩展提供弹性,横向扩展支持区域 AI 工厂。它们共同构成了分布式 AI 的支柱,在可容忍的延迟范围内连接计算、数据和代理。

 

以太网和 InfiniBand:企业买家在哪里找到战略契合点(以及原因)

该幻灯片总结了我们对 AI 工作负载结构的调查(与 ZK Research 合作完成),与上述 Bob Laliberte 的分析相吻合。这种结构辩论在网络社区中被广泛讨论,但我们认为这是一个“和”而不是“或”讨论。

 

sjgc05 

 

上述数据显示,59% 的组织更喜欢以太网用于 AI,而 38% 的组织更喜欢 InfiniBand。 其理由是,以太网已经支撑了大多数环境(46% 的人表示它在网络的其余部分使用),团队拥有技能(44%),并且云对此进行了标准化(43%)。InfiniBand 在性能方面占据了高地,因为近 60% 的采用者提到“更好的性能”——而且它通常与集群 GPU 系统打包在一起。它也是高性能计算环境的主要内容。但随着 AI 调整的实施(例如 RoCE v2、EVPN/VXLAN、丰富的遥测)和新芯片推动确定性和吞吐量更高,以太网正在缩小性能差距。

 

要点:

  • 以太网:熟悉、可扩展、云对齐、性能提升

  • InfiniBand:最适合对性能最敏感、紧密耦合的训练集群

关键要点: 我们相信以太网将主导企业 AI 数据中心,而 InfiniBand 将持续存在,绝对性能胜过其他一切。

 

AI 驱动的革命:数据中心支出转向加速计算

下面的预测(2025 年春季更新)量化了正在进行的扩建,包括建筑基础设施、电力、冷却、计算、存储、网络和核心系统软件。


sjgc06 


为了进行更深入的分析,读者可以参考之前的突发分析,其中包含有关此数据的详细信息以及进一步的细分,包括本地/企业和云削减。

 

多年来,数据中心建设支出徘徊在 2000 亿美元左右。2024 年,它从 2220 亿美元跃升至 3500 亿美元(同比+58%),在我们的预测中,它设定了新的轨迹。

该模型显示:

  • 24-'35 年总 DC 支出复合年增长率:到 ~2031 年将达到 ~16% 至 1 万亿美元

  • AI 极限/加速计算复合年增长率:~23%

  • 传统计算复合年增长率:–13%,随着预算转向人工智能工厂而缩小

  • 混合移位:到 2030 年,AI Extreme 将从支出的 ~8%(2020 年)上升到 ~85%

  • 如今,Nvidia 占据了 ~25% 的 DC 支出(并在模型内保持份额)。

  • 堆栈翻转现在在超大规模企业、新云和人工智能实验室的损益表中可见。资本支出主要集中在 GPU 系统和高带宽网络上,分解存储所占的比例低于传统数据中心支出,并且包括电源/冷却。传统的通用设备极大地让位于加速计算。


关键要点: 我们相信,人工智能工厂正在将传统数据中心模型从稳定的成本中心转变为增长引擎,加速计算将推动未来十年及以后的曲线。

 

人工智能工厂的全球收入:谁抓住了优势?

下图描绘了人工智能工厂到 2030 年产生的收入。它故意与之前的资本支出下滑形成鲜明对比,到 2030 年,支出将接近 ~1 万亿美元,而人工智能工厂产生的收入略低于 ~5000 亿美元——这并不出乎意料,但数字很大,差距很大。

 

sjgc07 

 

收入不是来自销售基本模型,而是来自通过工厂 API 构建的软件。前提是工厂公开连接,让供应商打包结果并按使用计费。

 

美国大获全胜;中国是强大的。美国在短期内处于领先地位,但中国“轰轰烈烈地进入”——在国内硬件/软件上建立国家工厂。即使使用蛮力规模和丰富的能源来完成,该规模也会在此预测中产生可观的收入。

 

OpenAI 保留先发优势。与我们 2023 年 1 月的预测相反,预计 OpenAI 在 2025 年的收入将达到 ~66 亿美元,随着消费者/专业消费者的吸引力和企业 API 采用的扩大而增长;该模型假设 OpenAI 执行并避免重大失误,到 2030 年将达到 ~1500 亿美元。尽管与其做出的资本支出承诺相比,这相形见绌,但该公司似乎有望保持其先发优势。

 

Anthropic 凭借强大的企业界面显示出势头;我们的观点是,人工智能研究实验室有不止一个的空间,但所有实验室都必须发展出超越“基础模型”的持久商业模式。换句话说,重要的不是法学硕士,而是构建在上面的软件。

 

Google LLC 和 Meta Platforms Inc.首先在内部获利(广告/参与度)。这支持了巨大的损益影响,但虽然有意义,但作为外部“模型收入”显示的较少。

 

Microsoft Corp. (微软公司)在两个方面“很好”——软件特许经营权和运营工厂。我们相信,其庞大的软件资产将保护它免受大规模中断。

 

云(“云在哪里?保持规模,但上行空间转移到将 API 转换为软件业务的平台。亚马逊云科技公司必须将庞大的通用计算基础过渡到人工智能经济学;领导层(Amazon.com 首席执行官 Andy Jassy、AWS 首席执行官 Matt Garman)的执行力是一个关键的观察项目。


要点:收入落后于资本支出,但加速转向将工厂 API 转变为可重复、以结果为中心的软件的参与者。美国领先,中国飙升,先行者——尤其是 OpenAI——从企业人工智能中受益,如果他们找到可持续模型,就有多个实验室的空间。

 

美资人工智能工厂按行业划分的收入

下图将美国公司从人工智能工厂中获得的全球收入分开。它是定向的;“其他”,中国的长尾最终可能会更大。我们目前没有很好的可见性和信心来预测中国和世界其他地区的贡献,这可能是巨大的,并将这些数字增加 3% 到 50%,甚至更多。

 

sjgc08 

 

我们相信企业对企业会赢得胜利。消费者/专业消费者开始了这一切,但未来的资金来自企业 API 和服务。其论点是,随着生产转移到人工智能工厂,传统数据中心会衰落;企业 IT 将通过 API 使用情报(许多不会运行工厂),因此公开可靠、受监管接口的供应商将捕获支出。这种观点假设 OpenAI(和同行)开发了一个可行的企业模型——将聊天机器人和编码的早期吸引力转变为企业值得信赖的计费服务。

 

政府贡献了相当多的金额,但增长速度较慢;采购周期和之前的限制(例如,广泛的 ChatGPT 禁令)延迟了采用。政策仍将塑造安全、数据驻留、出口规则很重要的市场,但到十年末,企业将为大部分收入提供资金。信任仍然是一个门控因素,因为企业在向第三方工厂发送专有数据之前会要求控制。

 

关键要点: 在我们看来,真正的钱是企业人工智能:首先是 API,其次是服务,B2B 的速度超过了消费者,而公共政策则设定了护栏。

 

互作性:开放标准作为通往人工智能工厂的门户

下面的幻灯片来自CUBE Research的代理人工智能期货指数显示了企业在未来18个月内将优先考虑哪些互作性。论点是生成式人工智能是一个门户——就像浏览器是通往互联网的门户一样——但价值通过后端的人工智能工厂流动。

 

sjgc09 

 

前提是,如果人工智能工厂开放,它们会更容易扩展——但社区对这种观点存在分歧。一方面,历史表明,当开放协议标准化互联网时,“浏览器战争”就结束了。同样,生成式人工智能前门(ChatGPT、Claude、Gemini、Grok)必须通过开放模型、协议和 API,以便智能能够被广泛使用和集成。

 

企业不希望碎片化或锁定;他们想要安全性、确定性和便携性。调查数据表明,59% 的受访者优先考虑开放模型/协议/API;58% 可扩展适配器/连接器;55% 的代理集成/协作;52% 的可组合工作流程(任何代理);52% 的常见语义层 (N=625)。

 

另一方面,由于每一次人工智能工厂建设都是一片“雪花”,需要高度定制,因此反驳表明,人工智能工厂堆栈的事实上的标准甚至专有元素可能会成为可行的,甚至获胜。在许多方面,英伟达代表了这场辩论的缩影。一方面,其专有的硬件和软件套件为人工智能的新时代提供了动力。与此同时,该公司采用了以太网等开放标准,并开源了人工智能、机器人、数据科学图形等领域的许多创新。

 

一般来说,我们的观点是,标准就像情报管道的“网格”——电路、断路器和调节器,使代理通信和代理控制平面变得实用。供应商(Nvidia、Advanced Micro Devices Inc.、Intel Corp. 等)正在采取措施,但正如所指出的,大多数人工智能工厂只是半开放的,并且存在碎片化的风险,就像云一样。正如斯科特·赫布纳 (Scott Hebner) 所说:“95% 的健康状况与 5% 的老鼠药仍然会杀死你;倡导行业全力以赴开放。

 

关键要点:我们的观点是,IT 浪潮的历史是通过事实上的标准赢得的,开放的法律标准被证明是生态系统飞轮的加速器。对于人工智能工厂大规模提供软件服务,我们相信开放标准将有助于智能在代理、应用程序和企业之间安全可靠地流动。但起点必然需要专有创新和垂直整合来证明投资回报率。

 

对位:抽象可能使“可见”标准黯然失色

之前的调查显示,企业需要开放的模型、协议和标准。这反映了当今 IT 的运作方式。相反的观点是大多数从业者和用户看到的层,将被 OpenAI 及其同行等软件领导者/创新者抽象化,可能还有云——它们将通过隐藏简单性背后的复杂性来竞争。

 

一个合理的论点是,客户端公开的体验将收敛到 API 和托管服务,从而隐藏管道。这在开发人员服务中已经有些明显,这些服务具有更丰富的原语、更紧密的集成和捆绑到单个产品中的固执己见的默认值。可能的前景是:

  • 将模型、工具、安全、数据平面挂钩等捆绑到一个服务中。

  • 由 API 内置的自动化策略控制、审计和合规性进行管理。

  • 集中扩展:人工智能工厂在大型数据中心运行;大多数公司不会运营它们,他们会消费它们。

 

尽管如此,提供商通过治理和透明度赢得了企业的信任,开放标准支持这种精神。从时间上讲,我们认为抽象层必须在 2027 年至 2028 年之前实现,届时我们的预测要求 OpenAI 的运行率将超过 400 亿至 500 亿美元,服务范围将成为“硬化顶部”。

 

关键要点:开放标准很重要,但可见的界面可能是简单的 API。在我们看来,一个成功的策略是将工业 AI 工厂包装在安全、受监管的抽象中,企业无需接触机制即可采用这些抽象。

 

加速计算和服务即软件:AppDev 视角

本节概述了人工智能工厂如何改变日常软件工作——开发人员构建什么、平台如何运行以及安全性所在。

 

sjgc10 

 

加速计算正在重新设定对延迟和规模的预期。到 2025 年,专用 GPU/张量处理单元/现场可编程门阵列将推动同比增长 ~46.8%,达到 ~1578 亿美元,从而实现实时分析、人工智能驱动的决策和大规模模拟。这种性能伴随着应用程序现代化。随着企业重新架构到云原生模式,与平台重构和持续集成/持续部署或 CI/CD 相关的服务将从 ~198 亿美元(2024 年)扩展到 ~396 亿美元(2029 年)。

 

运营模式也随之变化。平台工程将重点从“提供基础设施”转移到“提供开发人员体验”。我们的研究表明,在内部开发人员门户、自助服务环境、基础设施即代码、容器和可观测性的推动下,共同管理平台为开发人员腾出 47% 的创新时间,而内部管理资产则为 38%。安全是持续的,而不是障碍。突出的 DevSecOps 趋势是:左移测试、人工智能辅助检测/响应和零信任。这些推动市场到 2030 年将达到 ~417 亿美元(~30.8% 复合年增长率)。人机交互仍然是一个关键的设计点。

 

所有这些都导致了作为软件的服务——代理的、以流程为中心的应用程序,这些应用程序在受监管的平台上运行,并通过结果而不是功能获利。获胜者将减少摩擦(减少胶水代码),提供安全的自助服务,并在速度加快的同时保持审计员和 SRE 的完整。

 

建议

  • 评估准备情况:以现代化和加速为目标;不要无缘无故地重构

  • 投资平台工程:通过强大的可观测性和自动化来建立安全的自助式 IDP

  • 嵌入 DevSecOps:通过 AI 辅助工作流和零信任,使安全性成为持续控制

 

关键要点:我们相信,加速、现代化、平台工程和 DevSecOps 的融合是 AI 工厂的运营行为,也是作为软件服务的实用途径。

 

市场地图:谁在争夺心智份额

企业技术研究散点图绘制了 y 轴上的支出动量(净得分)与 x 轴上的安装渗透率/重叠,涵盖所有行业的 ~1,800 名受访者。这是一个跨生态系统的快照——而不是单一的类别削减。

 

sjgc11 

 

右上角挤满了超大规模企业和领先的人工智能平台——Microsoft、AWS、谷歌、OpenAI——以及其他存在较少的人工智能实验室(Anthropic、Meta 等)。– Nvidia 势头强劲,反映了其在加速计算方面的核心作用。网络(Arista Networks Inc.、Cisco Systems Inc.、Juniper Networks Inc.)、半导体(AMD、Intel、Broadcom Inc.)、基础设施 OEM(HPE、Dell)和“新云”(CoreWeave Inc.、Lambda Labs Inc. 等)与甲骨文公司一起完善了该集团。在人工智能中发挥更突出的作用。我们还将公共部门(山姆大叔)和中国(包括政府和主要人工智能参与者)标记为结构性需求驱动因素和政策制定者,并注意到随着产能和电力成为门控资源,能源公司(未显示)的作用不断扩大。

 

传达的信息不仅仅是谁很热门;这是企业计划购买的地方,因为他们将继续通过高度并行性增强自己的数据中心(为 Nvidia 等人提供支持),但最重要的合作伙伴将是 (1) 暴露工厂功能的 API 提供商和 (2) 将这些 API 打包成结果的软件供应商。这就是支出转化为利润的地方。

 

关键要点:我们的观点是,人工智能工厂创造了数万亿美元的机会,但价值却存在分歧:镐和铲子赢得了扩建,而 API + 软件提供商则通过将制造的智能转化为业务成果来赢得经常性收入。

人工智能工厂:未来的数据中心 | AIYXL