R-Zero 展示了大语言模型如何自我训练:无需任何人工标记的数据

8.29 他们首先根据数学问题训练模型,然后测试学到的推理技能是否可以推广到其他复杂的通用领域基准测试,例如MMLU-Pro多语言理解和推理任务和SuperGPQA科学和推理任务

2025082903
来源:VB/ChatGPT


腾讯人工智能实验室和圣路易斯华盛顿大学的研究人员开发了一个新的训练框架,使大型语言模型 (LLM) 能够自我改进,而无需任何人工标记的数据。这项名为 R-Zero 的技术使用强化学习从头开始生成自己的训练数据,解决了创建自我进化人工智能系统的主要瓶颈之一。R-Zero 的工作原理是让两个独立的模型通过相互交互和挑战来共同进化。

 

实验表明,R-Zero 显着提高了不同 LLM 的推理能力,这可以降低训练高级 AI 的复杂性和成本。对于企业来说,这种方法可以加速复杂推理任务的专用模型的开发,而无需花费大量资金来管理标记数据集。

 

自我进化的大语言模型的挑战

自我进化的大语言模型背后的想法是创建可以自主生成、完善和学习自身经验的人工智能系统。这为实现更智能、更强大的人工智能提供了一条可扩展的途径。然而,一个主要挑战是训练这些模型需要大量的高质量任务和标签,这些任务和标签可以作为人工智能学习的监督信号。

 

依靠人类注释者创建这些数据不仅成本高昂且速度缓慢,而且还会造成根本性瓶颈。它有效地将人工智能的潜在能力限制在人类可以教给它的能力。为了解决这个问题,研究人员开发了无标签方法,直接从模型自己的输出中获取奖励信号,例如,通过衡量其对答案的置信度。虽然这些方法消除了对显式标签的需求,但它们仍然依赖于一组预先存在的任务,从而限制了它们在真正自我进化场景中的适用性。

 

其他方法涉及让模型生成自己的任务以从中学习。然而,在开放式推理等领域,没有简单的方法来检查正确性(例如代码执行器),确保这种自生成数据的质量是一个重大障碍。

 

R-Zero 的工作原理

R-Zero 是一个旨在训练推理 LLM 的框架,这些 LLM 可以从零外部数据演变而来。该过程从单个基础模型开始,该模型分为两个角色:“挑战者”和“求解器”。这两个模型是独立优化的,但通过连续的交互循环共同演变。

 

挑战者的目标是创建新任务,这些任务正好处于求解器当前能力的门槛,既不太容易也不太不可能。反过来,求解器会因解决这些日益复杂的任务而获得奖励。在给 VB 的书面评论中,该论文的合著者、圣路易斯华盛顿大学博士生黄成松解释说,这种动态至关重要,因为生成高质量的问题通常比找到答案更复杂。

 

2025082901

 

“我们在实际环境中发现,最大的挑战不是生成答案......而是生成高质量、新颖且逐渐变得更加困难的问题,”黄说。“我们相信,好老师比好学生少得多。共同进化的动态自动创建了这个'老师',确保了稳定和动态的课程,将求解器的功能推向了远远超出静态的、预先存在的数据集所能实现的范围。

 

一旦挑战者生成了足够的问题,它们就会被过滤出多样性并编译到训练数据集中。在求解器的训练阶段,它会针对这些具有挑战性的问题进行微调。每个问题的“正确”答案由求解器自己之前尝试的多数票决定。

 

整个过程重复进行,创建一个自我改进的循环,无需任何人工干预即可运行,使两个模型能够相互推动,在每次迭代中逐渐变得更强大。

 

R-Zero 在行动

研究人员在几个开源大语言模型上测试了 R-Zero,包括来自 Qwen3 和 OctoThinker 家族的模型。他们首先根据数学问题训练模型,然后测试学到的推理技能是否可以推广到其他复杂的通用领域基准测试,例如 MMLU-Pro(多语言理解和推理任务)和 SuperGPQA(科学和推理任务)。

 

结果表明,R-Zero是一个高效的、与模型无关的框架。例如,它在数学推理基准测试中将 Qwen3-4B-Base 模型的平均得分提高了 +6.49。训练过程始终如一地大幅提高了性能,并在多次迭代中积累了收益。更大的 Qwen3-8B-Base 模型在三次迭代后,其平均数学分数上升了 +5.51 分。


2025082902 

 

一个关键发现是第一次迭代后立即实现性能飞跃,这验证了挑战者在创建高质量学习课程方面的作用的有效性。“这证实了经过 RL 训练的挑战者生成的智能课程比未经训练的生成器生成的智能课程更有效,”研究人员在他们的论文中写道。

值得注意的是,从数学问题中学到的技能被有效地转移到一般推理任务中,从而增强了模型的底层能力。例如,相同的 Qwen3-4B-Base 模型在通用领域推理基准上显示出 +7.54 的改进。另一个有趣的发现是 R-Zero 可以作为决定性的预训练步骤。R-Zero 首先改进的模型在后来对传统标记数据进行微调时实现了更高的性能,这表明该框架充当了性能放大器。

 

对于企业来说,“从零数据开始”的方法可能会改变游戏规则,尤其是在高质量数据稀缺或不存在的利基领域。黄强调,R-Zero 的主要优势在于它能够避开人工智能开发中最昂贵、最耗时的部分:数据管理。

 

“我们的方法完全绕过了必须查找、标记和策划高质量数据集的基本瓶颈,”他说。“这不仅仅是一项节省成本的措施;这是一条创造可以超越人类能力的人工智能的途径,因为它不再受到人类知识或数据范围的限制。

 

然而,共同进化的过程也揭示了一个关键的挑战。随着挑战者成功地生成越来越困难的问题,求解器通过多数票产生可靠“正确”答案的能力开始下降。研究人员发现,与GPT -4等强大的预言机LLM相比,这些自生成标签的真实准确率从第一次迭代的79%下降到第三次迭代的63%。这种数据质量的下降是一个关键的权衡,也是系统长期性能的潜在瓶颈。

 

黄承认这是自我进化范式的一个根本问题。“我们的工作是一次概念验证,展示了这种方法的潜力,但我们承认,保持稳定、长期的改进而不趋于稳定是一个重大障碍,”他说。“解决这个问题将是整个研究界至关重要的下一步。”

 

研究人员还强调了该框架的一个关键局限性:当前的机制最适合数学等可以客观确定正确性的领域。那么,如何将这种强大的范式扩展到更主观的企业任务,例如生成营销文案或总结报告呢?

 

黄仁勋建议,潜在的前进道路是添加第三个共同进化的人工智能代理:“验证者”或“批评者”。

 

“该验证器将接受训练,根据更细致的标准评估求解器输出的质量,而不是评估简单的'正确'答案,”他解释道。“然后,共同进化的动态将涉及挑战者创建提示、求解器生成响应以及验证者提供高质量信号,所有三个模型共同改进。”

 

虽然这仍然是未来研究的一个方向,但它指向了一个未来,即完全自主的人工智能系统不仅可以掌握客观逻辑,还可以掌握主观推理。