
Nous Research 是一家秘密的人工智能初创公司,已成为开源人工智能运动的领军人物,周一悄悄发布了 Hermes 4,这是一个大型语言模型系列,该公司声称可以与领先的专有系统的性能相媲美,同时提供前所未有的用户控制和最小的内容限制。
该版本代表了开源人工智能倡导者和主要科技公司之间关于谁应该控制先进人工智能功能的访问的斗争的重大升级。与 OpenAI、Google 或 Anthropic 的模型不同,Hermes 4 旨在响应几乎任何请求,而无需商业人工智能系统中已成为标准的安全护栏。
“Hermes 4 建立在我们传统的用户对齐模型之上,具有扩展的测试时间计算能力,”Nous Research 在 X(以前称为 Twitter)上宣布。“特别注意使模型具有创意和有趣的交互,不受审查制度的阻碍,并且中立地对齐,同时保持开放权重模型最先进的数学、编码和推理性能。”
Hermes 4 的“混合推理”模式如何在数学基准测试中优于 ChatGPT 和 Claude
Hermes 4 引入了 Nous Research 所说的“混合推理”,允许用户在快速响应和更深入的分步思维过程之间切换。激活后,这些模型会在提供最终答案之前在特殊标签中生成内部推理——类似于 OpenAI 的 o1 推理模型,但对人工智能的思维过程完全透明。
技术成果可观。在测试中,Hermes 4 最大的 4050 亿参数模型在推理模式下的 MATH-500 基准测试中得分为 96.3%,在具有挑战性的 AIME'24 数学竞赛中得分为 81.9%——性能可与许多多花费数百万美元的专有系统相媲美或超过。
“挑战在于让思维痕迹变得有用且可验证,而无需失控的推理,”人工智能研究员 Rohan Paul 在 X 上指出,并强调了该版本中的技术突破之一。
也许最值得注意的是,Hermes 4 在“RefusalBench”上获得了所有测试模型中的最高分,这是 Nous Research 创建的一个新基准,用于衡量人工智能系统拒绝回答问题的频率。该模型在推理模式下得分为 57.1%,明显优于 GPT-4o(17.67%)和 Claude Sonnet 4(17%)。

Nous Research 的 Hermes 4 模型回答的问题明显多于 RefusalBench 上的竞争 AI 系统,RefusalBench 是一项衡量模型拒绝响应用户请求的频率的测试。(图片来源:Nous Research)
DataForge 和 Atropos 内部:Hermes 4 功能背后的突破性训练系统
Hermes 4 的功能背后是 Nous Research 多年来开发的复杂培训基础设施。这些模型使用两个新系统进行训练:DataForge(一种基于图形的合成数据生成器)和 Atropos(一种开源强化学习框架)。
DataForge 通过该公司所说的有向图“随机游走”来创建训练数据,将简单的预训练数据转换为复杂的指令遵循示例。例如,该系统可以将维基百科文章转换为说唱歌曲,然后根据该转换生成问题和答案。
与此同时,Atropos 的运作方式类似于数百个专门的训练环境,人工智能模型在其中练习特定技能(数学、编码、工具使用和创意写作),只有在产生正确的解决方案时才会收到反馈。这种“拒绝抽样”方法确保只有经过验证的高质量响应才能进入训练数据。
“Nous 使用这些环境为 Hermes 4 生成了数据集!”投资了 Nous Research 的 Delphi Ventures 风险投资家 Tommy Shaughnessy 解释道。“数据集中的所有内容都包含 350 万个推理样本和 160 万个非推理样本!Hermes 是根据 RL 数据进行训练的,而不仅仅是问答的静态数据集!
训练过程需要 192 个 Nvidia B200 GPU 和 71,616 个 GPU 小时来制作最大的模型——这是一项重大但并非前所未有的计算投资,展示了专业技术如何与大规模的科技巨头竞争。
为什么 Nous Research 认为人工智能安全护栏“令人讨厌”并损害创新
Nous Research 的声誉建立在将用户控制置于企业内容政策之上的理念之上。该公司的模型被设计为“可纵”的,这意味着它们可以进行微调或提示以特定方式运行,而不受商业人工智能系统特有的严格安全限制。
“Hermes 4 没有受到免责声明、规则和过度谨慎的束缚,这非常烦人,并且损害了创新和可用性,”Shaughnessy 在分析该版本的详细帖子中写道。“如果它是开源的,但拒绝了所有请求,那就毫无意义了。爱马仕 4 不是问题。
这种方法使 Nous Research 在想要最大灵活性的人工智能研究人员和开发人员中广受欢迎,但它也使该公司成为有关人工智能安全和内容审核的持续争论的中心。虽然这些模型理论上可以用于有害目的,但 Nous Research 认为透明度和用户控制比企业把关更可取。
该公司的技术报告与模型一起发布,提供了有关训练过程、评估结果,甚至基准测试的实际文本输出的前所未有的细节。“我们相信这份报告为基准测试的透明度设定了新标准,”该公司表示。
一家拥有 192 个 GPU 的小型初创公司如何与大型科技公司数十亿美元的人工智能预算竞争
Hermes 4 的发布正值人工智能行业的关键时刻。虽然大型科技公司已投入数十亿美元开发越来越强大的人工智能系统,但日益壮大的开源运动认为,这些能力不应由少数公司控制。
近几个月来,开源人工智能取得了重大进展,Meta 的 Llama 3.1、DeepSeek 的 R1 和阿里巴巴的 Qwen 系列等模型实现了可与专有系统相媲美的性能。Hermes 4 代表了这一进展的又一步,特别是在推理领域——长期以来被认为是 OpenAI 的 o1 等封闭系统的优势。
“首先,Nous 是一家拥有数十名才华横溢的初创公司,”Shaughnessy 指出。“他们没有超大规模企业 $100b+ 的年度资本支出支出,也没有 1,000 多名员工,尽管如此,他们仍在继续以疯狂的速度推出创新模型和研究。”
这家初创公司今年早些时候在 Paradigm 的领投下筹集了 6500 万美元的资金,还一直在开发 Psyche Network,这是一个分布式训练系统,旨在使用区块链技术协调联网计算机之间的人工智能训练。
阻止 Hermes 4 无限循环思考的技术修复
Hermes 4 最重要的技术贡献之一解决了困扰推理模型的问题:思维过程过长。研究人员发现,他们较小的 140 亿参数模型在推理时会在 60% 的时间内达到最大上下文长度,基本上陷入了无限的思维循环。
他们的解决方案涉及第二个训练阶段,教模型在恰好 30,000 个标记处停止推理,将过长生成减少 65-79%,同时保持大部分推理性能。这种“长度控制”技术可能对更广泛的人工智能研究界很有价值。
“较小的模型 (<14B) 在提炼时往往会过度思考,但较大的模型不会,”人工智能研究员 Muyu He 在 X 上观察到,并强调了技术报告的见解。
然而,Hermes 4 仍然面临开源模型常见的局限性。尽管基准测试性能令人印象深刻,但这些模型需要大量的计算资源才能运行,并且可能无法与许多应用程序的商业人工智能服务的易用性或可靠性相匹配。
在哪里可以尝试 Hermes 4 以及与 ChatGPT 和 Claude 相比的成本是多少
Nous Research 通过多种渠道提供 Hermes 4,体现了开源理念。模型权重可在 Hugging Face 上免费下载,同时该公司还通过改进的聊天界面以及与 Chutes、Nebius 和 Luminal 等推理提供商的合作伙伴关系提供 API 访问。
“您可以在新的、改进的 Nous Chat UI 中试用 Hermes 4,”该公司宣布,并强调了并行交互和内存系统等功能。
对于企业用户和研究人员来说,这些模型代表了一种潜在的有吸引力的替代方案,可以替代对专有系统的 API 访问付费,特别是对于需要高水平定制或处理敏感内容的应用程序。
大局观:Hermes 4 对人工智能发展的未来意味着什么
Hermes 4 的发布不仅仅是一次人工智能模型的发布,它还代表了谁应该控制人工智能未来的声明。在一个日益由少数拥有几乎无限资源的科技巨头主导的行业中,Nous Research 已经证明,创新仍然可以来自意想不到的地方。
该公司的方法提出了关于安全性和能力之间、公司控制与用户自由之间权衡的基本问题。虽然主要科技公司认为,仔细的内容审核和安全护栏对于负责任的人工智能部署至关重要,但 Nous Research 认为透明度和用户代理比企业施加的限制更重要。
这种理念最终是有益的还是有问题的,还有待观察。但有一点是肯定的:《爱马仕 4》已经表明,人工智能的未来不会仅仅由财力雄厚的公司决定。
在一个昨天的不可能成为明天的商品的领域,Nous Research 刚刚证明,唯一比说不的人工智能更危险的可能是愿意说“是”的人工智能。