中国电信全栈自研,开源国产千亿参数MoE大模型TeleChat3

1.5 MoE架构的核心优势在于,它通过动态专家调用+稀疏化计算,在保持稠密模型推理深度的同时,显著降低了计算资源的消耗,实现了高精度与高效率的完美平衡

近日,中国电信人工智能研究院(TeleAI)正式开源其星辰语义大模型系列的最新力作——TeleChat3。这一发布不仅标志着中国电信在大模型领域的又一次重大技术突破,更因其“全国产化”的特性,在国内AI界引发了广泛关注。


2026-01-05_160903_150

 

国产化里程碑:从算力到数据的全栈自主

 

TeleChat3系列模型的最大亮点在于其“全国产化”的基因。该模型完全依托于上海临港的国产万卡算力集群进行训练,基础训练数据规模高达15万亿tokens。这一成就意味着从底层硬件到上层算法,整个训练链条实现了自主可控,为我国在超大规模AI模型领域的独立发展迈出了关键一步。

 

此次开源包含两个主要版本:一是TeleChat3-105B-A4.7B-Thinking,这是一个千亿参数级别的细粒度混合专家(MoE)模型;二是TeleChat3-36B-Thinking,一个性能强劲的稠密架构模型。

 

技术解析:细粒度MoE与“思考”模式

 

其中,TeleChat3-105B-A4.7B-Thinking作为国内首个全国产化训练的千亿参数细粒度MoE模型,其架构设计尤为精妙。该模型由1个共享专家和192个路由专家组成,在每次推理时动态激活其中的4个专家。这种设计使得模型总参数量达到1050亿,而实际激活的参数仅为47亿。MoE架构的核心优势在于,它通过“动态专家调用+稀疏化计算”,在保持稠密模型推理深度的同时,显著降低了计算资源的消耗,实现了“高精度与高效率”的完美平衡。

 

此外,TeleChat3全系模型均引入了创新的“Thinking”(思考)模式。通过在对话模板中加入特定的引导符号,模型能够自动生成中间推理步骤,从而大幅提升其在处理数学、代码等复杂任务时的逻辑性和准确性。


2026-01-05_161024_776

 

开源生态与行业影响

 

作为央企中首个开源的系列语义大模型,中国电信持续构建其开放的AI生态。参考其过往模型(如TeleChat2系列)的开源实践,TeleChat3的权重文件预计也将同步发布在GitHub、Gitee以及国内的ModelScope(魔搭)社区等多个平台,以方便全球开发者和研究者使用与研究。

 

此举对国内AI产业具有深远意义。一方面,它为国内AI社区提供了一个高性能、可信赖的国产大模型基座,降低了行业应用的门槛;另一方面,其全栈自研的特性也向世界展示了中国在AI核心技术领域的自主创新能力,对于推动我国AI产业的健康发展和国际竞争力提升具有重要战略价值。


项目地址:https://github.com/Tele-AI/TeleChat3