万亿参数储备仅激活百亿参数,在保证顶尖精度的同时降低推理成本,成为大模型发展路径上的新突破。
10月9日凌晨,蚂蚁集团正式发布并开源了万亿参数通用语言模型Ling-1T,这是蚂蚁百灵大模型Ling 2.0系列的首款旗舰模型,也是该团队迄今规模最大、能力最强的“非思考”大模型。
与追求更长推理链的思考模型不同,Ling-1T瞄准在有限输出token条件下直接给出高质量推理结果,试图在推理精度和效率间找到最佳平衡点。
在备受关注的竞赛数学榜单AIME 25上,Ling-1T以70.42%的准确率优于Gemini-2.5-Pro的70.10%,同时将平均推理长度从约7000个token缩短到约4300个,节省了近40%的推理成本。
模型定位:非思考模型的高效之路
Ling-1T的发布标志着大模型发展路径的多元化。蚂蚁团队明确了“思考模型”与“非思考模型”的分野。
思考模型如OpenAI的o1、DeepSeek-R1等,通过生成冗长的推理链来提升准确率,而Ling-1T则反其道而行,追求在有限输出内直接给出精准答案。
这种设计理念更贴近实际应用场景。
用户通常只需要最终答案而非漫长的思考过程,这使非思考模型在产业落地中具有天然优势。
模型效率的提升不仅降低了计算成本,更使大模型在资源受限环境中的部署成为可能。
技术架构:万亿参数的精密设计
Ling-1T采用MoE架构,总参数量达到1万亿,但每个token仅激活约510亿参数,实现了“万亿储备,百亿开销”的高效推理模式。
架构设计上,Ling-1T采用了前几层密集、后面层MoE的混合设计。
这种设计主要是为了缓解浅层网络的专家路由不均衡问题,提升模型稳定性。
训练过程包含三个关键阶段:
Pretrain Stage 1使用10T token的高知识密度语料
Pretrain Stage 2使用10T token的高推理浓度语料,推理语料占比超过40%
Mid-training阶段扩展上下文到128K并加入思维链语料
值得一提的是,Ling-1T全程采用FP8混合精度训练,是已知规模最大的使用FP8训练的基座模型,带来了15%+的端到端加速和显著的显存节省。
性能表现:多项基准领先
Ling-1T在多项复杂推理基准中取得了SOTA表现。
在代码生成与软件开发方面,Ling-1T在LiveCodeBench真实编程推理任务上得分最高,显著高于DeepSeek。
在ArtifactsBench前端能力基准上得分59.31,仅次于Gemini-2.5-Pro-lowthink的60.28,位居开源模型榜首。
数学推理能力上,Ling-1T在Omni-Math与UGMathBench双双突破74分大关,在FinanceReasoning金融推理测试中达到87.45,展现出强大的逻辑一致性与跨领域推理能力。
知识理解维度同样出色,在C-Eval、MMLU-Redux、MMLU-Pro等关键数据集上均处于领先或并列领先位置,整体比DeepSeek、Kimi、GPT-5主干模型普遍高出1-3个百分点。

创新训练方法:LPO与混合奖励机制
在强化学习阶段,蚂蚁团队创新性地提出了LPO方法,即以“句子”为粒度的策略优化算法。
与传统方法相比,LPO既避免了词元级别的破碎感,也克服了序列级别的笼统性,使奖励信号与模型行为在语义层面实现更精准的对齐。
蚂蚁团队还提出了“语法-功能-美学”的混合奖励机制,在确保代码正确、功能完善的同时,持续提升这个万亿基座对视觉美学的认知。
这一创新使Ling-1T在生成前端界面时不仅能实现功能需求,还能把握视觉美感。
泛化能力:超越预期的跨领域表现
研发过程中,蚂蚁团队多次观察到扩大模型规模与强化推理能力带来的出乎意料的跨领域泛化表现。
在智能体工具调用任务BFCL V3上,Ling-1T虽未在中训练阶段引入大量操作轨迹,仅通过少量指令微调,即可达到约70%的调用准确率。
这种卓越的推理迁移与泛化能力,使Ling-1T能精准理解复杂自然语言指令,自主完成综合性任务:将模糊的逻辑问题转化为功能完备的可视化组件,为多端环境生成高兼容性前端代码,或根据指定风格与语气创作营销文案。
这些能力构成了通用智能体的关键基础,为大模型的实际应用开辟了更多可能性。
应用前景:从编程到科普的多元场景
实测显示,Ling-1T能快速生成高质量的前端界面代码,精准实现字体样式、头像形状、布局等详细要求,对抽象视觉要求也能准确把握。
在科普方面,Ling-1T能用“穿墙术”比喻讲解量子隧穿效应,用苹果、折纸、牙签的比喻解释虫洞概念,把复杂科学原理讲得直观易懂。
创意写作能力同样出色,它能按要求以《星际穿越》中的诗歌为灵感,撰写富有张力的播客开场白,创作几乎可直接发布的小红书文案。
工具调用能力让Ling-1T不仅能回答问题,还能真正调动外部资源、执行复杂任务,如推荐真实存在的小众徒步路线,并提供地理信息、季节性建议等落地性极强的信息。
局限性:未来迭代方向
尽管取得显著进展,Ling-1T仍存在一些局限性。
其attention架构仍基于GQA,在超长上下文和复杂推理任务中表现稳定但推理成本偏高。后续将引入混合注意力架构,提升训练推理效率、降低算力开销。
智能体能力仍需强化,当前版本在多轮交互、长期记忆和复杂工具使用等方面仍有限。近期将持续提升工具理解与使用能力,增强模型的主动性与泛化能力。
部分场景下仍可能出现指令执行偏差或角色混淆。后续将通过强化式身份对齐与安全微调改进模型一致性。
目前,Ling-1T已在Hugging Face、ModelScope等平台开源,开发者可自由下载使用。在线体验平台ling.tbox.cn也已对外开放,普通用户可亲身感受这一万亿参数模型的强大能力。
大模型竞争正从单纯的规模比拼转向效率范式,如何在增强大的同时实现更省、更快、更稳的日常表现,成为行业关键课题。
Ling-1T给效率革命交了一份更贴近场景的答卷——万亿级储备,百亿级开销,产业级落地。
HuggingFace:https://huggingface.co/inclusionAI/Ling-1T
ModelScope:https://modelscope.cn/models/inclusionAI/Ling-1T
GitHub:https://github.com/inclusionAI/Ling-V2
Ling chat(国内用户):https://ling.tbox.cn/chat
ZenMux(海外开发者,提供 Chat 测试与 API 等能力):https://zenmux.ai/inclusionai/ling-1t