
流行艺术色彩鲜艳的深蓝色背景,白色和橙色的人脑被绿色、蓝色和红色的球体和线条包围
大多数对生成式人工智能感兴趣的人可能已经知道,大型语言模型 (LLM)——例如 ChatGPT、Anthropic 的 Claude 和 Google 的 Gemini 背后的模型——都是基于海量数据集进行训练的:这些数据集包含数万亿个单词,取自网站、书籍、代码库,以及越来越多地来自图像、音频和视频等其他媒体。但为什么呢?
通过这些数据,法学硕士可以对语言、语言模式和世界形成统计的、广义的理解——以人工神经元网络(将输入数据转换为输出信号的数学函数)中数十亿个参数或“设置”的形式进行编码。
通过接触所有这些训练数据,LLM 学会了检测并概括其神经元参数中反映的模式。例如,“苹果”一词经常出现在与食物、水果或树木相关的术语附近,有时也出现在与计算机相关的术语附近。该模型会识别出苹果可以是红色、绿色或黄色,有时甚至是腐烂或稀有的其他颜色,在英语中拼写为“apple”,并且可以食用。这些统计知识会影响模型在用户输入提示时的响应方式——根据从训练数据中“学习”到的关联来塑造其生成的输出。
但即使在人工智能研究人员中,仍然存在一个大问题:法学硕士的训练数据中有多少用于构建概念的广义表示,有多少是逐字记忆或以与原始数据相同或几乎相同的方式存储的?
这不仅对于更好地理解LLM的运作方式以及何时出错至关重要,而且对于模型提供商在数据创建者和所有者(例如艺术家和唱片公司)提起的版权侵权诉讼中为自己辩护也至关重要。如果LLM被证明逐字复制了其训练数据的大部分内容,法院更有可能支持原告,认为这些模型非法复制了受保护的材料。如果不是这样——如果发现这些模型是基于广义模式而非精确复制来生成输出——开发人员或许能够根据现有法律抗辩(例如合理使用)继续抓取和训练受版权保护的数据。
现在,我们终于对 LLM 的记忆量和概括量有了答案:本周,Meta、Google DeepMind、康奈尔大学和 NVIDIA 的研究人员发布的一项新研究发现,GPT 风格的模型每个参数的固定记忆容量约为 3.6 位。
要了解 3.6 位在实践中意味着什么:
单个位是数字数据的最小单位,代表 0 或 1。八个位组成一个字节。
存储 3.6 位可容纳大约 12.13 个不同的值,按 2^3.6 计算。
这是从 12 个选项中选择一个所需的信息量——类似于选择一年中的某个月份或掷 12 面骰子的结果。
它甚至不足以存储一个英文字母(需要大约 4.7 位),但足以从一组减少的 10 个常用英文字母中编码一个字符(需要大约 3.32 位)。
以字节为单位,3.6 位为 0.45 字节 - 小于 ASCII 中存储的典型字符(使用 8 位或 1 字节)大小的一半。
在合理的架构变化范围内,此数值与模型无关:不同的深度、宽度和精度会产生相似的结果。该估算值在不同模型大小甚至精度水平下均保持稳定,全精度模型的数值略高(最高可达 3.83 位/参数)。
更多的训练数据并不会带来更多的记忆——事实上,模型不太可能记住任何单个数据点
这项研究的一个关键结论是,模型并不会因为训练数据越多而记忆越多。相反,模型的固定容量会分布在整个数据集中,这意味着每个单独的数据点受到的关注度会降低。
主要作者杰克·莫里斯 (Jack Morris)通过社交网络 X 解释说,“使用更多数据进行训练将迫使模型在每个样本上记忆更少的信息。”
这些发现可能有助于缓解人们对大型模型记住受版权保护或敏感内容的担忧。
如果记忆有限,并被稀释于众多示例,那么重现任何一个特定训练示例的可能性就会降低。本质上,更多的训练数据会带来更安全的泛化行为,而不是增加风险。
研究人员如何发现这些发现
为了精确量化语言模型的记忆量,研究人员采用了一种非常规但强大的方法:他们在由均匀随机位串组成的数据集上训练 Transformer 模型。每个位串都经过独立采样,以确保样本之间不存在任何模式、结构或冗余。
由于每个样本都是独一无二的,没有共同的特征,因此模型在评估期间重建或识别这些字符串所表现出的任何能力都直接反映了它在训练期间保留或记忆的信息量。
这种设置的关键原因在于彻底消除泛化的可能性。与充满语法结构、语义重叠和重复概念的自然语言不同,均匀随机数据不包含此类信息。每个示例本质上都是噪声,彼此之间没有任何统计关系。在这种情况下,模型在测试数据上的任何表现都必须纯粹来自于对训练示例的记忆,因为没有可供泛化的分布模式。
作者认为,他们的方法可能是在实践中将记忆与学习分离的唯一原则性方法之一,因为当 LLM 接受真实语言训练时,即使它们产生与训练数据相匹配的输出,也很难知道它们是记住了输入还是仅仅从它们观察到的模式推断出底层结构。
这种方法使研究人员能够映射模型参数数量与存储总信息量之间的直接关系。通过逐步增加模型规模并将每个变体训练至饱和状态,研究人员对参数数量从 50 万到 15 亿的模型进行了数百次实验,观察到了一致的结果:每个参数记忆 3.6 位,他们将此报告为 LLM 内存容量的基本衡量标准。
该团队还将他们的方法应用于基于真实数据集训练的模型。在文本训练中,模型表现出了记忆力和泛化能力的平衡。
较小的数据集鼓励更多的记忆,但随着数据集规模的增加,模型转向学习可推广的模式。这种转变以“双重下降”现象为标志,即模型性能会暂时下降,然后在推广开始后逐渐提升。
该研究还考察了模型精度(比较使用 bfloat16 和 float32 进行训练)对记忆容量的影响。他们观察到,当切换到完整的 32 位精度时,每个参数的位数略有提升,从 3.51 位增加到 3.83 位。然而,这种增益远低于可用位数翻倍所带来的收益,这意味着更高精度带来的收益递减。
独特的数据更容易被记住
本文提出了一种缩放定律,将模型的容量和数据集大小与成员推理攻击的有效性联系起来。
这些攻击试图确定特定数据点是否属于模型的训练集。研究表明,随着数据集规模的增长,此类攻击会变得不可靠,这支持了大规模训练有助于降低隐私风险的论点。
虽然该论文关注的是平均行为,但一些研究人员指出,某些类型的数据(例如高度独特或风格化的写作)可能仍然更容易被记住。
作者承认这一局限性,并强调他们的方法旨在描述一般趋势而不是边缘情况。
迈向人类对 LLM 理解的更深理解
通过引入一个原则性且可量化的记忆定义,该研究为开发者和研究人员提供了评估语言模型行为的新工具。这不仅有助于提高模型透明度,还有助于提高人工智能开发中的合规性、隐私性和道德标准。研究结果表明,在训练大规模语言模型时,更多数据(而不是更少数据)可能是更安全的途径。
从整体上看模型记忆:
一个 500K 参数的模型可以记忆大约 180 万比特,或 225 KB 的数据。
一个 15 亿参数的模型可以容纳大约 54 亿比特,或 675 兆字节的原始信息。
这与图像等典型的文件存储无法相比(例如,3.6 MB 的未压缩图像约为 3000 万比特),但当分布在离散的文本模式中时,这一点很重要。