Meta 的新小推理模型显示行业向企业应用微型人工智能的转变

9.21 这些模型总共训练了大约5万亿个标记相比之下,其他类似大小模型中的数十万亿个标记,包括来自Llama-3.1-8B-Instruct的蒸馏数据,它有效地转移了其高级推理能力,而无需大量的训练成本

2025-09-21_094910_123
来源:VentureBeat


长期以来,人工智能模型的力量一直与其规模相关,模型已增长到数千亿或数万亿个参数。但超大型模型对企业来说需要进行明显的权衡,包括缺乏对底层系统的控制、对第三方云的依赖以及不可预测的成本。

 

现在,一种逆势正在加速,小型语言模型 (SLM) 旨在在 PC 和手机上本地运行。最新、最有力的例子是 Meta 的 MobileLLM-R1,这是一个提供专业推理的十亿以下参数模型系列。它的发布是更广泛的行业推动开发紧凑、强大的模型的一部分,这些模型挑战了“越大越好”的叙述。

 

Meta 的 MobileLLM-R1:设备上推理专家

Meta 的 MobileLLM-R1 是一系列推理模型,有 140M、360M 和 950M 参数大小,专为数学、编码和科学推理而构建(它们不适合一般聊天应用程序)。

这些模型基于 Meta 在原始 MobileLLM 模型中提出的一些设计选择而变得更加高效,这些选择专门针对低于 10 亿参数的架构进行了优化。例如,他们使用“深薄”架构(更喜欢更多的层而不是更大的嵌入维度)和成熟的技术,如分组查询注意力(一种共享注意力权重以减少模型中参数数量的技术)。这种设计选择与非常高效的训练过程相结合,使模型能够在资源受限的设备上执行复杂的任务。

 

这些模型总共训练了大约 5 万亿个标记(相比之下,其他类似大小模型中的数十万亿个标记),包括来自 Llama-3.1-8B-Instruct 的蒸馏数据,它有效地转移了其高级推理能力,而无需大量的训练成本。


2025-09-21_094941_649
来源:VentureBeat

 

950M 模型在 MATH 基准测试中略胜于阿里巴巴的 Qwen3-0.6B(74.0 对 73.0),并在 LiveCodeBench 编码测试中建立了明显的领先优势(19.9 对 14.9)。这使其成为需要可靠离线逻辑的应用的理想选择,例如开发人员工具中的设备上代码辅助。

 

然而,有一个重大问题:该模型是在 Meta 的 FAIR 非商业许可下发布的,该许可严格禁止将该模型或其输出用于任何商业用途。对于企业来说,这将 MobileLLM-R1 定位为强大的研究蓝图或内部工具,而不是可以货币化的生产就绪资产。(Meta 的 Hugging Face 页面显示“MobileLLM-R1 目前已获得 FAIR NC 许可”,这意味着它将来可能会发生变化。

 

小语言模型的竞争格局

虽然 MobileLLM-R1 突破了性能界限,但更广泛的 SLM 领域提供了针对不同企业需求量身定制的商业上可行的替代方案。例如,谷歌的 Gemma 3 270M 是一款超高效的主力。它仅具有 2.7 亿个参数,旨在实现极致的节能。内部测试显示,25 次对话消耗的电池电量不到手机电池的 1%。其宽松的许可证使其成为希望为内容审核或合规性检查等任务微调一组小型专用模型的公司的绝佳选择。

 

对于需要强大、开箱即用且不受许可限制的推理的企业来说,阿里巴巴的 Qwen3-0.6B 是一个主要的竞争者。凭借其 Apache-2.0 许可证和可与 MobileLLM-R1 相媲美的性能,它是一种实用的商业就绪替代方案。与此同时,其他参与者正在专注于企业控制和新功能。Nvidia 的 Nemotron-Nano 提供独特的“控制旋钮”,允许开发人员通过简单的命令打开或关闭推理,并设置“思维预算”以平衡速度和准确性。Liquid AI 正在通过处理文本和视觉的模型与专为快速部署而设计的开发人员工具包相结合,推动设备端多模态的发展。Liquid AI 正在试验“液体神经网络”,这是一种新颖的架构,有望降低运行高性能 AI 系统的计算和内存成本。

 

从“上帝模型”到“专家舰队”

这种全行业向 SLM 的转变是对企业痛点的直接回应。对大型第三方云模型的依赖会产生不可预测的成本,并且使公司几乎无法控制模型更新或弃用。正如 Liquid AI 首席执行官 Ramin Hasani 在最近的一次采访中告诉 VentureBeat 的那样,“企业正在意识到小型模型提供了可预测性。您可以为模型授权一次,然后在设备上无限使用,而不是按 API 调用付费。此举还解决了隐私和可靠性问题,因为在本地处理敏感数据可以增强合规性并确保应用程序在没有持续互联网连接的情况下工作。潜在影响是巨大的,哈萨尼看到了“到 2035 年小模型制度中数万亿美元的机会”。

 

功能强大的 SLM 的可用性支持新的架构手册。组织可以部署一组专业模型,而不是依赖一个大型通用模型。这种策略类似于软件行业从单体应用程序到微服务的转变,涉及将复杂的问题分解为一系列更小的重复子任务,每个子任务都由微调的 SLM 处理。

 

这种方法更符合向代理应用程序的逐渐转变,其中任务分布在专门的代理之间。据 Nvidia 研究人员称,目前大型语言模型 (LLM) 的主导地位往往“过度且与大多数代理用例的功能需求不一致”。另一方面,队列方法更符合人工智能代理的工作方式,从而降低成本、提高速度并在发生故障时实现更清晰的可见性。

这不会使大型模型过时。相反,他们将承担一个新的角色。正如人工智能研究员安德烈·卡帕西 (Andrej Karpathy) 所解释的那样,当今最大的模型足够强大,可以“重构训练数据并将其塑造成理想的合成格式”,可用于将纯粹的推理技能提炼成更小、更高效的继任者。这创造了一种共生关系,每一代海量模型都有助于为下一代敏捷 SLM 创建完美的训练集,从而使 AI 开发更具可持续性。

 

Meta、谷歌、英伟达和其他公司的同时采取的举措证实了该行业正在拥抱更加务实的人工智能未来。“越大越好”的时代还没有结束,但它不再是城里唯一的游戏。小模型的价值主张现在是不可否认的。并非每个问题都需要 1750 亿参数的锤子。对于越来越多的企业用例,更锋利的工具就是更小的工具。