DeepSeek R1 在强化学习上的大胆押注:它是如何以 3% 的成本超越 OpenAI的

1.27 组织可能需要重新评估他们与专有AI提供商的合作伙伴关系,考虑当开源替代方案可以提供可比如果不是更优越的结果时,与这些服务相关的高成本是否合理

20250127180340


DeepSeek R1 周一的发布在 AI 社区中引起了震动,打破了关于实现尖端 AI 性能所需条件的假设。这种开源模型的成本仅为 OpenAI 的 o1 的 3%-5%,不仅吸引了开发人员,还挑战企业重新思考其 AI 战略。

该模型已飙升至 HuggingFace 上下载量最高的模型(截至撰写本文时已下载了 109,000 次)——因为开发人员争先恐后地尝试并试图了解它对他们的 AI 开发意味着什么。用户评论说,DeepSeek 的附带搜索功能(您可以在 DeepSeek 的网站上找到)现在优于 OpenAI 和 Perplexity 等竞争对手,仅次于 Google 的 Gemini Deep Research。

对企业 AI 战略的影响是深远的:随着成本的降低和开放访问,企业现在有了替代 OpenAI 等昂贵的专有模型的替代方案。DeepSeek 的发布可以使对尖端 AI 功能的访问民主化,使较小的组织能够在 AI 军备竞赛中有效竞争。

这个故事重点介绍了 DeepSeek 如何实现这一壮举,以及它对 AI 模型的大量用户意味着什么。对于开发 AI 驱动解决方案的企业来说,DeepSeek 的突破挑战了 OpenAI 主导地位的假设,并为具有成本效益的创新提供了蓝图。DeepSeek 的“方式”应该是最具教育意义的。


DeepSeek 的突破:转向纯强化学习

11 月,DeepSeek 宣布其性能已超越 OpenAI 的 o1,但当时它只提供了有限的 R1-lite-preview 模型,从而成为头条新闻。随着周一 R1 的完整发布和随附的技术论文,该公司揭示了一项令人惊讶的创新:故意背离了广泛用于训练大型语言模型 (LLM) 的传统监督微调 (SFT) 流程。

SFT 是 AI 开发的一个标准步骤,涉及在精选数据集上训练模型以教授分步推理,通常称为思维链 (CoT)。它被认为对于提高推理能力至关重要。然而,DeepSeek 通过完全跳过 SFT,选择依靠强化学习 (RL) 来训练模型来挑战这一假设。

这一大胆的举动迫使 DeepSeek-R1 发展独立推理能力,避免了规范性数据集经常引入的脆弱性。虽然出现了一些缺陷,导致团队在构建模型的最后阶段重新引入了有限数量的 SFT,但结果证实了根本性的突破:仅强化学习就可以带来实质性的性能提升。


该公司使用开源取得了很大进展 - 这是一种传统且不足为奇的方式

首先,关于 DeepSeek 如何取得今天的成就的一些背景。DeepSeek 是中国对冲基金 High-Flyer Quant 于 2023 年分拆出来的公司,最初为其专有聊天机器人开发 AI 模型,然后发布供公众使用。人们对该公司的确切方法知之甚少,但它很快就开源了自己的模型,而且该公司极有可能建立在 Meta 制作的开放项目之上,例如 Llama 模型和 ML 库 Pytorch。

为了训练其模型,High-Flyer Quant 在美国出口限制之前获得了超过 10,000 个 Nvidia GPU,据报道,尽管存在贸易壁垒,但通过替代供应路线扩展到了 50,000 个 GPU。与 OpenAI、Google 和 Anthropic 等领先的 AI 实验室相比,这相形见绌,这些实验室每个实验室都拥有超过 500,000 个 GPU。

DeepSeek 能够用有限的资源取得有竞争力的结果,这凸显了独创性和足智多谋如何挑战培训最先进 LLM 的高成本范式。


尽管有猜测,但 DeepSeek 的全部预算尚不清楚

据 Nvidia 工程师 Jim Fan 称,据报道,DeepSeek 在两个月内以 558 万美元的预算训练了其基础模型(称为 V3)。虽然该公司尚未透露其使用的确切训练数据(旁注:批评者说这意味着 DeepSeek 并不是真正的开源),但现代技术使 Web 和开放数据集上的训练越来越容易获得。估计训练 DeepSeek-R1 的总成本具有挑战性。虽然运行 50,000 个 GPU 意味着大量支出(可能数亿美元),但确切的数字仍然是推测性的。

不过,很明显,DeepSeek 从一开始就非常具有创新性。去年,有报道称 DeepSeek 正在进行一些初步创新,例如专家混合和多头潜在注意力。

[更新:这是一份非常详细的报告,由 Jeffrey Emanuel 刚刚发布,介绍了 DeepSeek 的各种基础设施创新,他是一名前量化投资者,现在是企业家。它很长,但非常好。请参阅“理论威胁”部分,了解其他三项值得一提的创新:(1) 混合精度训练,允许 DeepSeek 在整个训练中使用 8 位浮点数,而不是 32 位浮点数——允许 DeepSeek 显著降低每个 GPU 的内存需求,转化为更少的 GPU 需求;(2) 推理过程中的多令牌预测;(3) 通过其 DualPipe 算法提高 GPU 通信效率,从而提高 GPU 利用率。


DeepSeek-R1 如何达到“顿悟时刻”

DeepSeek-R1 的最终迭代之旅始于一个中间模型 DeepSeek-R1-Zero,该模型使用纯强化学习进行训练。通过完全依赖 RL,DeepSeek 激励该模型独立思考,奖励正确答案和用于得出答案的逻辑过程。

这种方法导致了一个意想不到的现象:该模型开始为更复杂的问题分配额外的处理时间,展示了根据任务的难度确定任务优先级的能力。DeepSeek 的研究人员将此描述为“顿悟时刻”,模型本身识别并阐明了具有挑战性问题的新解决方案(见下面的屏幕截图)。这一里程碑强调了强化学习的力量,可以在不依赖 SFT 等传统训练方法的情况下解锁高级推理能力。


20250127180402
来源:DeepSeek-R1 论文。


不要让这个图形吓到你。关键的要点是红线,模型从字面上使用了“顿悟时刻”一词。研究人员将此作为模型能够以拟人化的语气重新思考问题的一个突出例子。对于研究人员来说,他们说这是他们自己的“顿悟时刻”。

研究人员得出结论:“它强调了强化学习的力量和美感:我们不是明确地教模型如何解决问题,而是简单地为它提供正确的激励措施,它就会自主开发高级的问题解决策略。


不仅仅是 RL

然而,该模型确实需要的不仅仅是 RL。该论文继续讨论了尽管 RL 创造了意想不到且强大的推理行为,但这个中间模型 DeepSeek-R1-Zero 确实面临着一些挑战,包括可读性差和语言混合(例如,从中文开始,然后切换到英文)。因此,直到那时,该团队才决定创建一个新模型,该模型将成为最终的 DeepSeek-R1 模型。该模型同样基于 V3 基础模型,首先注入了有限的 SFT,专注于“少量长 CoT 数据”或所谓的冷启动数据,以解决一些挑战。之后,它经历了与 R1-Zero 相同的强化学习过程。然后,该论文讨论了 R1 如何进行最后一轮微调。


后果

一个问题是为什么这个版本会带来如此多的惊喜。开源模型并不是新的。开源模型背后有巨大的逻辑和动力。它们的免费成本和可塑性是我们最近报道这些模型将在企业中获胜的原因。

例如,Meta 的开放权重模型 Llama 3 去年大受欢迎,因为它是由想要自己的自定义模型的开发人员进行微调的。同样,现在 DeepSeek-R1 已经被用来将其推理提炼成一系列其他更小的模型——不同之处在于 DeepSeek 提供了行业领先的性能。例如,这包括在手机上运行模型的微小版本。

DeepSeek-R1 不仅比领先的开源替代方案 Llama 3 表现更好。它透明地展示了其答案的整个思维链。Meta 的 Llama 没有被指示默认这样做;这需要 Llama 的积极提示才能做到这一点。

透明度也为 OpenAI 提供了公关黑眼圈,到目前为止,OpenAI 一直向用户隐藏其思维链,引用竞争原因,而不是在模型出错时让用户感到困惑。透明度使开发人员能够查明并解决模型推理中的错误,简化定制以更有效地满足企业需求。

对于企业决策者来说,DeepSeek 的成功突显了 AI 领域的更广泛转变:更精简、更高效的开发实践越来越可行。组织可能需要重新评估他们与专有 AI 提供商的合作伙伴关系,考虑当开源替代方案可以提供可比(如果不是更优越)的结果时,与这些服务相关的高成本是否合理。


可以肯定的是,没有巨大的领先优势

虽然 DeepSeek 的创新具有开创性,但它绝没有建立起压倒性的市场领先地位。因为它发布了自己的研究,其他模型公司将从中学习并适应。Meta 和法国开源模型公司 Mistral 可能落后一球,但可能只需要几个月就可以赶上。正如 Meta 的首席研究员 Yann Lecun 所说:“这个想法是每个人都从其他人的想法中获利。没有人会'超过'任何人,也没有国家会'输给'另一个国家。没有人垄断了好的想法。每个人都在向其他人学习。因此,执行才是最重要的。

最终,消费者、初创公司和其他用户将受益最多,因为 DeepSeek 的产品将继续使使用这些模型的价格接近零(同样,除了在推理中运行模型的成本)。这种快速商品化可能会给在专有基础设施上投入大量资金的领先 AI 提供商带来挑战——实际上是巨大的痛苦。正如许多评论员所说,包括 Meta 的投资者和前高管 Chamath Palihapitiya,这可能意味着 OpenAI 和其他公司多年的运营支出和资本支出将被浪费。


围绕 OpenAI 大笔投资的投资回报率的问题比比皆是

这一切都对 OpenAI、Microsoft 和其他公司所追求的投资计划提出了重大问题。OpenAI 的 5000 亿美元的 Stargate 项目反映了其致力于构建大规模数据中心以支持其高级模型的承诺。在甲骨文和软银等合作伙伴的支持下,这一战略的前提是实现通用人工智能 (AGI) 需要前所未有的计算资源。然而,DeepSeek 以极低的成本展示了高性能模型,这挑战了这种方法的可持续性,让人怀疑 OpenAI 是否有能力从如此巨大的投资中获得回报。

企业家兼评论员 Arnaud Bertrand 捕捉到了这一动态,将中国节俭、分散的创新与美国对集中式资源密集型基础设施的依赖进行了对比:“这是关于世界意识到,中国在技术和创新方面已经赶上了美国,并在某些领域超越了美国,尽管人们努力阻止这种情况。事实上,昨天另一家中国公司字节跳动发布了豆包-1.5-pro,其中包括一个”深度思考“模式,在 AIME 基准测试中超过了 OpenAI 的 o1。