智谱上线GLM-5.3-FlashX:最高200 tokens/s,国产芯片撑起“速度版”旗舰

9.18 此前的Flash以120于GLM-5.3的价格树立了性价比标杆,如今的FlashX则通过速度溢价满足了不同开发者的差异化需求追求极致成本可继续使用Flash,追求极致响应速度则可选择FlashX

9月18日,智谱正式推出GLM-5.3-FlashX,最高推理速度达200 tokens/s,为企业与开发者带来更快、更流畅的模型体验。API已同步上线,Model Key为GLM-5.3-FlashX。

2026-09-19_112053_119

从Ox Alpha到FlashX:匿名测试到速度升级

GLM-5.3-Flash此前以匿名模型Ox Alpha(中文社区称“牛来”)之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在10万张国产芯片提供的推理算力基础上,进一步加大对Infra侧的投入与推理优化。

智谱表示,GLM-5.3-Flash长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。

性能表现:综合智能指数57分,比肩Claude Opus 4.8

GLM-5.3-Flash总参数量为320B,激活参数仅18B,是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在Artificial Analysis Intelligence Index中取得57分,进入全球前沿模型能力区间,与Anthropic的Claude Opus 4.8得分持平。

在编程与Agent能力上,其表现同样与Claude Opus 4.8相当,原生支持最长1M上下文、图片与视频输入。

定价策略:FlashX定位“速度溢价”

GLM-5.3-FlashX相比GLM-5.3-Flash价格更高,形成清晰的产品梯度:

模型上下文输入(元/百万Token)输出(元/百万Token)缓存命中(元/百万Token)输入模态
GLM-5.31M8282文本
GLM-5.3-Flash1M0.82.80.23图片、视频、文件、文本
GLM-5.3-FlashX1M270.57图片、视频、文件、文本

FlashX的定价约为Flash的2.5倍,但换来更快的推理速度。对于需要高频调用、低延迟响应的场景(如实时Agent、交互式编程),这一“速度溢价”具备明确的价值。

国产芯片承载:10万卡集群支撑全球流量

GLM-5.3-FlashX的提速背后,是智谱在超过10万张国产芯片集群上的持续投入。此前匿名测试期间,全部请求流量均由国产芯片承载,峰值日处理能力达100万亿Token,通过自研高带宽互联网络连接,并基于SGLang构建了专用推理引擎,端到端服务性能相比初始基线提升3倍。

这一实践表明,国产算力已具备承载全球顶级大模型推理的能力,并在成本与效率上逐步逼近国际主流方案。

GLM-5.3-FlashX的推出,标志着智谱的策略正在从“极致性价比”向“性能梯度产品化”演进。此前的Flash以1/20于GLM-5.3的价格树立了性价比标杆,如今的FlashX则通过“速度溢价”满足了不同开发者的差异化需求——追求极致成本可继续使用Flash,追求极致响应速度则可选择FlashX。这种清晰的产品矩阵,正是大模型厂商走向成熟的标志。而这一切的底座,是10万张国产芯片的稳定支撑。