
亚利桑那州立大学研究人员的一项新研究表明,大型语言模型 (LLM) 中著名的“思维链”(CoT) 推理可能更像是“脆弱的海市蜃楼”,而不是真正的智能。该研究建立在越来越多的工作之上,质疑 LLM 推理的深度,但它需要一个独特的“数据分布”视角来测试 CoT 在何处以及为何系统地分解。
对于应用程序构建者来说至关重要的是,该论文超越了批评,就如何在开发 LLM 驱动的应用程序时考虑这些限制(从测试策略到微调的作用)提供了清晰、实用的指导。
思维链的前景和问题
CoT 提示要求大语言模型“一步一步思考”,在复杂的任务上显示出令人印象深刻的结果,导致人们认为模型正在参与类似人类的推理过程。然而,仔细检查往往会发现挑战这一观点的逻辑不一致。
各种研究表明,大语言模型经常依赖于表面语义和线索,而不是逻辑程序。这些模型通过重复它们在训练过程中看到的标记模式来生成听起来合理的逻辑。尽管如此,这种方法在偏离熟悉模板的任务或引入不相关信息时经常会失败。
尽管有这些观察结果,但这项新研究的研究人员认为,“系统地了解 CoT 推理失败的原因和时间仍然是一个谜”,他们的研究旨在解决这一点。之前的工作已经表明,大语言模型很难推广他们的推理能力。正如论文所指出的,“理论和经验证据表明,只有当测试输入与训练数据共享潜在结构时,CoT 才能很好地泛化;否则,性能会急剧下降。
大语言模型推理的新视角
亚利桑那州立大学的研究人员提出了一个新的视角来看待这个问题:CoT 不是一种推理行为,而是一种复杂的模式匹配形式,从根本上受其训练数据中的统计模式的约束。他们认为“CoT 的成功不是源于模型固有的推理能力,而是源于它有条件地推广到结构上类似于分布式示例的分布外 (OOD) 测试用例的能力。换句话说,LLM 擅长将旧模式应用于看起来相似的新数据,但不擅长解决真正新颖的问题。

数据分发透镜 来源:GitHub
为了检验这一假设,他们从“分布偏移”(训练数据和测试数据之间的变化)三个维度剖析了 CoT 的能力。首先,他们测试了“任务泛化”,看看模型是否可以将学习到的推理过程应用于新型任务。其次,他们检查了“长度泛化”,以确定它是否可以处理比它训练的推理链长或短得多的推理链。最后,他们评估了“格式泛化”,以衡量模型对提示措辞或结构的微小变化的敏感程度。
为了进行分析,他们开发了一个名为 DataAlchemy 的框架,可以在受控环境中从头开始训练较小的法学硕士,使他们能够精确测量超出训练数据时性能如何下降。
“数据分发镜头和受控环境都是我们试图传达的核心,”亚利桑那州立大学博士生、该论文的合著者赵成帅告诉我们。“我们希望创造一个空间,让公众、研究人员和开发人员可以自由探索和探索法学硕士的本质,并推进人类知识的边界。”
海市蜃楼证实
根据他们的发现,研究人员得出结论,CoT 推理是“结构化模式匹配的一种复杂形式,从根本上受训练期间看到的数据分布的限制”。即使超出此分布,当测试时,性能也会崩溃。看起来像结构化推理的东西更像是海市蜃楼,“从训练数据中记忆或插值的模式中出现,而不是逻辑推理。
所有三个维度的细分都是一致的。在新任务上,模型未能概括,而是复制了它们在训练过程中看到的最接近的模式。当面对不同长度的推理链时,他们会遇到困难,经常试图人为地添加或删除步骤以匹配训练示例的长度。最后,他们的表现被证明对提示的表面变化高度敏感,尤其是核心元素和指令的变化。
有趣的是,研究人员发现这些故障可以快速修复。通过监督微调 (SFT) 在非常小的新的、看不见的数据样本上微调模型,该特定类型问题的性能迅速提高。然而,这种快速修复进一步支持了模式匹配理论,表明该模型并没有学习更抽象的推理,而只是记住一种新模式来克服特定的弱点。
企业的要点
研究人员向从业者发出了直接警告,强调了“依赖 CoT 作为推理任务的即插即用解决方案的风险,并警告不要将 CoT 风格的输出等同于人类思维。他们为使用 LLM 构建应用程序的开发人员提供了三个关键建议。
1)防止过度依赖和虚假信心。CoT 不应被视为金融或法律分析等高风险领域推理的可靠模块。法学硕士可以产生“流利的废话”(似是而非但逻辑上有缺陷的推理),这比完全错误的答案更具欺骗性。
“这并不意味着企业应该完全放弃它——它仍然可以在熟悉的分销任务中提供价值。赵说,关键是不要将其视为“即插即用”的推理引擎,“并补充说,在金融或健康等高风险领域,领域专家的严格审计、多模型交叉检查和后备策略等护栏是”如果要安全使用 CoT 输出,那么必不可少“。
2) Prioritize 分布外 (OOD) 测试。标准验证(其中测试数据反映训练数据)不足以衡量真正的稳健性。开发人员必须实施严格的测试,系统地探测任务、长度和格式变化的故障。
3)将微调视为补丁,而不是灵丹妙药。虽然监督微调 (SFT) 可以快速“修补”模型在特定新数据分布上的性能,但它并不能创建真正的泛化。它只是稍微扩大了模型的“分布内泡沫”。依靠 SFT 来修复每个 OOD 故障是一种不可持续的策略,无法解决模型核心缺乏抽象推理的问题。
“对于企业来说,这意味着 SFT 应该被理解为一种短期缓解措施,而不是长期解决方案,”赵说。“随着新的 OOD 场景的出现,完全依赖 SFT 可能会造成不断修补的循环。更可持续的路径将需要投资来开发模型,这些模型可以超越复杂的模式匹配,转向真正可推广的推理。
虽然 CoT 不是人类认知的一种形式,但这种限制是可以控制的。大多数企业应用程序涉及一组相对狭窄且可预测的任务。该论文的研究结果为确保这些领域的可靠性提供了蓝图。开发人员可以构建严格的评估套件,根据应用程序将遇到的特定任务、长度和格式变化系统地测试模型性能。这使他们能够绘制出模型“分布内”舒适区的边界,并确定它在哪些方面符合他们的特定需求。
这种有针对性的测试将微调从反应性“补丁”转变为主动的对齐策略。当评估发现特定弱点时,开发人员可以创建小型、有针对性的 SFT 数据集来解决它。这种方法不是试图实现广泛的、一般性的推理,而是外科手术地使用 SFT 来确保模型的模式匹配能力与特定企业任务的轮廓精确对齐。
“我们的论文强调了重要的局限性,但我们仍然对未来充满希望,”赵说。“前进的道路仍然开放,目前还没有一种方法可以宣布解决方案......真正的进步可能从各个方面出现,但最重要的是,科学的进步应该保持以人为本:机器可以提供帮助,但真正的发现将继续取决于人性和好奇心。