
来源:VB/Midjourney
一个多月前,中国人工智能初创公司 DeepSeek(香港幻方资本管理公司的子公司)发布了其热门开源模型 DeepSeek 的最新版本 R1-0528。
与它的前身 DeepSeek-R1 一样——它以如此便宜的训练成本和在推理任务中的表现震撼了 AI 和全球商业界,所有这些都免费提供给开发人员和企业——R1-0528 已经被其他 AI 实验室和开发人员改编和重新混合,这在很大程度上要归功于其宽松的 Apache 2.0 许可证。
本周,拥有 24 年历史的德国公司 TNG Technology Consulting GmbH 发布了这样一个版本:DeepSeek-TNG R1T2 Chimera,这是其 Chimera 大型语言模型 (LLM) 系列的最新型号。R1T2 在效率和速度方面得到了显著提升,得分在 R1-0528 的智能基准测试分数中超过 90%,而生成的答案不到 R1-0528 输出令牌数量的 40%。
这意味着它会产生更短的响应,直接转化为更快的推理和更低的计算成本。在 TNG 在 AI 代码共享社区 Hugging Face 上为其新 R1T2 发布的模型卡上,该公司表示它“比普通 R20 快约 1%(1 月份发布的那款)”比 R1-0528 快两倍多“(DeepSeek 5 月的官方更新)。
AI 开发者社区的反应已经非常积极。“该死!DeepSeek R1T2 - 比R1-0528快200%,比R1快20%,“Hugging Face的高级领导者Vaibhav (VB) Srivastav在X上写道。“明显优于GPQA和AIME 24的R1,通过DS V3、R1和R1-0528的专家大会制作 - 而且它是麻省理工学院的许可,可以在Hugging Face上使用。”
这种增益是通过 TNG 的专家汇编 (AoE) 方法实现的,该方法通过选择性地合并来自多个预训练模型的权重张量(内部参数)来构建 LLM,TNG 在 5 月份发表在非同行评审的开放获取在线期刊 arXiv 上的一篇论文中对此进行了描述。
作为原始 R1T Chimera 的继任者,R1T2 引入了一种新的“Tri-Mind”配置,它集成了三个父模型:DeepSeek-R1-0528、DeepSeek-R1 和 DeepSeek-V3-0324。结果是模型经过精心设计,可以保持高推理能力,同时显著降低推理成本。
R1T2 的构建无需进一步的微调或重新训练。它继承了 R1-0528 的推理强度、R1 的结构化思维模式以及 V3-0324 的简洁、面向指令的行为,为企业和研究使用提供了更高效但功能更强大的模型。
专家集合 (AoE) 与专家混合 (MoE) 有何不同
Mixture-of-Experts (MoE) 是一种架构设计,其中每个输入都有条件地激活不同的组件或“专家”。在 DeepSeek-V3 或 Mixtral 等 MoE LLM 中,在任何给定令牌的正向传递期间,只有模型的专家层子集(例如,256 个中的 8 个)处于活动状态。这使得超大型模型能够实现更高的参数数量和专业化,同时保持推理成本可控,因为每个令牌只评估网络的一小部分。
专家集合 (AoE) 是一种模型合并技术,而不是一种架构。它用于通过选择性地插值多个预训练的 MoE 模型权重张量来创建新模型。
AoE 中的“专家”是指被合并的模型组件——通常是 MoE 层中的路由专家张量——而不是在运行时动态激活的专家。
TNG 的 AoE 实现主要侧重于合并路由的专家张量(模型中最负责专业推理的部分),同时通常保留 V3-0324 等更快模型中更高效的共享层和注意力层。这种方法使生成的 Chimera 模型能够继承推理强度,而不会复制最强父模型的详细程度或延迟。
性能和速度:基准测试实际显示的内容
根据 TNG 提供的基准比较,R1T2 的推理性能是其最智能的父级 DeepSeek-R1-0528 的 90% 到 92%,通过 AIME-24、AIME-25 和 GPQA-Diamond 测试集测得。
然而,与 DeepSeek-R1-0528 不同的是,R1T2 的设计更加简洁。它提供类似的智能响应,同时使用的单词明显更少。
TNG 不关注原始处理时间或每秒令牌数,而是根据每个答案的输出令牌数量来衡量“速度”——这是成本和延迟的实用代表。根据 TNG 共享的基准,R1T2 使用 R1-0528 所需令牌的大约 40% 生成响应。
这意味着输出长度减少了 60%,这直接减少了推理时间和计算负载,将响应速度提高了 2 倍,即 200%。
与原来的 DeepSeek-R1 相比,R1T2 的简洁性平均也提高了约 20%,为高吞吐量或成本敏感型部署提供了显著的效率提升。
这种效率并不是以牺牲智能为代价的。如 TNG 技术论文中提供的基准图表所示,R1T2 位于情报与产出成本曲线上的理想区域。它保持了推理质量,同时最大限度地减少了冗长性 — 这对于推理速度、吞吐量和成本都很重要的企业应用程序至关重要。
部署注意事项和可用性
R1T2 在宽松的 MIT 许可证下发布,现在可在 Hugging Face 上使用,这意味着它是开源的,可以使用并内置到商业应用程序中。
TNG 指出,虽然该模型非常适合一般推理任务,但由于继承自 DeepSeek-R1 谱系的限制,目前不建议将其用于需要函数调用或使用工具的使用案例。这些问题可能会在未来的更新中得到解决。
该公司还建议欧洲用户评估对 2025 年 8 月 2 日生效的欧盟人工智能法案的合规性。
在欧盟经营的企业应审查相关规定,如果无法满足要求,则考虑在该日期之后停止使用模型。
但是,在国内运营并为美国用户或其他国家/地区的用户提供服务的美国公司不受欧盟 AI 法案条款的约束,该法案应该为他们在使用和部署这种免费、快速的开源推理模型时提供相当大的灵活性。如果他们为欧盟的用户提供服务,则《欧盟法案》的某些规定仍将适用。
TNG 已经通过 OpenRouter 和 Chutes 等平台提供了之前的 Chimera 变体,据报道,他们每天在这些平台上处理数十亿个代币。R1T2 的发布代表了这项公开可用性工作的进一步发展。
关于 TNG Technology Consulting GmbH
TNG Technology Consulting GmbH 成立于 2001 年 1 月,总部位于德国巴伐利亚州,拥有 900 多名员工,其中博士和技术专家非常集中。
该公司专注于软件开发、人工智能和 DevOps/云服务,为电信、保险、汽车、电子商务和物流等行业的主要企业客户提供服务。
TNG 是一家基于价值观的咨询合作伙伴。其独特的结构以运筹学和自我管理原则为基础,支持技术创新文化。
它积极为开源社区和研究做出贡献,如 R1T2 等公开版本及其 Assembly-of-Experts 方法的发布所证明。
对企业技术决策者意味着什么
对于 CTO、AI 平台所有者、工程主管和 IT 采购团队,R1T2 引入了切实的好处和战略选项:
降低推理成本:R1T2 每个任务的输出令牌更少,减少了 GPU 时间和能耗,直接转化为基础设施节省,这在高吞吐量或实时环境中尤为重要。
无开销的高推理质量:它保留了 R1-0528 等顶级模型的大部分推理能力,但没有它们的冗长。这对于结构化任务(数学、编程、逻辑)来说是理想的,在这些任务中,简洁的答案是可取的。
开放且可修改:MIT 许可证允许完全部署控制和定制,在受监管或气隙环境中实现私有托管、模型对齐或进一步培训。
新兴的模块化:AoE 方法预示着模型以模块化方式构建的未来,允许企业通过重新组合现有模型的优势来组装专门的变体,而不是从头开始重新训练。
注意事项:依赖函数调用、工具使用或高级代理编排的企业应注意当前的限制,尽管未来的 Chimera 更新可能会解决这些差距。
研究论文:
https://arxiv.org/abs/2506.14794
开源地址:
https://huggingface.co/tngtech/DeepSeek-TNG-R1T2-Chimera