DeepSeek 如何改变硅谷的 AI 格局

1.31 特朗普总统周一表示,DeepSeek应该为美国人工智能公司敲响警钟,同时赞扬中国人工智能实验室的开放态度

20250131164446


中国人工智能实验室 DeepSeek 在发布了与 OpenAI、Meta 和 Google 所能提供的最佳技术竞争的开放版本的 AI 模型后,引发了 2025 年硅谷的第一次恐慌。

DeepSeek 声称已经高效、快速地构建了其模型(尽管有些人对这些说法持怀疑态度),并且以美国 AI 公司收费的一小部分价格提供这些模型。这一发展不仅让科技巨头感到不安,也让美国政府最高层感到不安,他们担心中国在 AI 军备竞赛中领先。

“如果现在很多人工智能实验室都在开战,我不会感到惊讶,”人工智能基础设施初创公司 Anyscale 的联合创始人罗伯特·西原 (Robert Nishihara) 在接受 TechCrunch 采访时说。

DeepSeek 的崛起标志着硅谷 AI 领域的一个转折点。AI 的首席执行官、创始人、研究人员和投资者告诉我们,DeepSeek 的模型对美国的 AI 政策有重大影响。此外,这些专家表示,这些模型是 AI 进步速度加快的指标。

“当然,DeepSeek 被过度炒作了,”纽约大学数据科学中心助理教授 Ravid Shwartz-Ziv 在接受采访时说。“但它仍然非常有趣,我们可以从中学到很多东西。”

实现 AI 思维的新方法

Workera 首席执行官兼斯坦福大学兼职讲师 Kian Katanforoosh 表示,DeepSeek 在创建 R1 模型时的关键创新之一是“纯强化学习”,这是一种试错法。

“[孩子] 可能会触摸热板,被烫伤,然后很快学会不再这样做,”Katanforoosh 通过短信说。“这就是纯粹的强化学习——根据反馈从试错中学习 [...]DeepSeek 的方法就是让模型仅通过经验来学习。

与其他尖端 AI 模型相比,DeepSeek 似乎更依赖强化学习。OpenAI 还使用强化学习技术来开发 o1,该公司在 DeepSeek 发布 R1 前几周就透露了这一点。该公司声称,OpenAI 即将推出的 o3 模型使用基本相似的方法实现了更好的性能,但也使用了额外的计算。

Katanforoosh 表示,强化学习是当今改进 AI 基础模型最有前途的方法之一。术语“基础模型”通常是指在大量数据(如来自网络的图像和文本)上训练的 AI 模型。其他 AI 实验室似乎可能会继续突破强化学习的极限以改进他们的 AI 模型,尤其是考虑到 DeepSeek 的成功。

就在几个月前,AI 公司发现自己还在努力提高其基础模型的性能。但是,强化学习等方法以及其他方法(如监督微调和测试时缩放)的成功表明,AI 的进步可能正在回升。

“R1 让我对保持高速进展的速度更有信心,”Ai2 的研究员内森·兰伯特 (Nathan Lambert) 在接受采访时说。

AI 政策的转折点

R1 可以在任何满足硬件要求的机器上下载和运行,在许多 AI 基准测试中达到或击败 o1。虽然这不是我们第一次看到像 OpenAI 这样的“封闭”模型和开放可用模型之间的性能差距缩小,但 DeepSeek 实现它的速度让业界感到震惊。

这可能会促使美国增加对开源甚至完全开源人工智能的投资,以便与中国竞争。Andreessen Horowitz (a16z) 的普通合伙人马丁·卡萨多 (Martin Casado) 告诉我们,DeepSeek 证明了过去两年的监管理由有多么“错误”。

“对于人工智能,我认为这只是向我们表明,[美国] 在我们的技术能力方面并不孤单,”卡萨多在接受采访时说。“非常有竞争力的解决方案可以来自任何地方,尤其是中国。我们不应该阻碍美国的创新,而应该大力投资它。开源在某种程度上并不能为中国提供支持。事实上,不允许我们的公司进行开源意味着我们的技术不会激增。

Casado 似乎指的是前总统拜登最近废除的人工智能行政命令和被否决的加州法案 SB 1047,这两项法案都遭到了 a16z 的强烈反对。a16z 认为,这两项措施都优先考虑防止“古怪的”人工智能世界末日情景,而不是美国的创新。更广泛地说,硅谷在 2024 年总体上成功地镇压了“人工智能末日运动”。a16z 和其他公司一再表示,围绕人工智能的真正担忧是美国失去了对中国的竞争优势。

鉴于 DeepSeek 的崛起,这种情况似乎更加明显。

a16z 对许多开放人工智能世界上最大的参与者进行了大量投资,包括 Databricks、Mistral 和 Black Forest Labs。这家风险投资公司也可能在为特朗普政府提供人工智能建议方面发挥巨大作用。前 a16z 合伙人 Sriram Krishnan 现在是特朗普的人工智能高级政策顾问。

特朗普总统周一表示,DeepSeek 应该为美国人工智能公司敲响“警钟”,同时赞扬中国人工智能实验室的开放态度。这与 a16z 对人工智能的立场非常吻合。

“DeepSeek R1 是人工智能的人造卫星时刻,”a16z 联合创始人 Marc Andreessen 在 X 上的一篇文章中说,他指的是几十年前苏联地球轨道航天器的发射,这促使美国认真投资其太空计划。

DeepSeek 的崛起似乎也改变了开放 AI 怀疑论者的想法,比如谷歌前首席执行官埃里克·施密特 (Eric Schmidt)。就在去年,施密特对西方开放 AI 模型在全球范围内的扩散表示担忧。但在周二发表的一篇专栏文章中,施密特表示,DeepSeek 的崛起标志着全球 AI 竞赛的“转折点”,并呼吁进一步投资美国的开放 AI。

展望未来

重要的是不要夸大 DeepSeek 的成就。

例如,一些分析师对 DeepSeek 的说法持怀疑态度,即它使用大约 2000 个较旧的 Nvidia GPU 训练了其前沿模型之一 DeepSeek V3,成本仅为 560 万美元——这在 AI 行业是微不足道的。毕竟,中国的 AI 实验室并不是一夜之间萌芽的,据报道,DeepSeek 拥有超过 50,000 个 Nvidia Hopper GPU 的库存。

DeepSeek 的模型也存在缺陷。根据信息可靠性组织 NewsGuard 的一项测试,当被问及与新闻相关的话题时,R1 在 83% 的时间里提供不准确或不回答的答案。

然后,还有知识产权盗窃的指控。OpenAI 表示,它有证据表明 DeepSeek 使用其 AI 模型来训练自己的模型,使用一种称为蒸馏的过程。如果属实,这将违反 OpenAI 的条款,也会使 DeepSeek 的成就不那么令人印象深刻。例如,伯克利的研究人员最近创建了一个仅花费 450 美元的提炼推理模型。(当然,OpenAI 目前正被多方起诉,指控其在训练自己的模型时侵犯版权。

尽管如此,DeepSeek 还是通过更高效的模型推动了发展,并且进行了创新。Lambert 指出,与 o1 不同,R1 向用户揭示了它的“思考过程”。Lambert 观察到,一些用户在看到 AI 推理模型的内部过程时更加信任或相信 AI 推理模型,在此期间他们“解释自己的工作”。

现在,我们必须看看美国的政策制定者和人工智能实验室如何应对。