1 月 20 日,智谱 AI 正式发布并开源其最新轻量级大语言模型 GLM-4.7-Flash。该模型采用混合专家(MoE)架构,总参数量达 300 亿(30B),但每次推理仅激活 30 亿(3B)参数,在保持高性能的同时显著降低计算开销,为轻量化部署提供了兼顾性能与效率的新选择 。
性能超越同级竞品,登顶开源 SOTA
在多个权威基准测试中,GLM-4.7-Flash 表现亮眼。根据官方和第三方评测数据,该模型在SWE-bench Verified 和 τ²-Bench 等主流编程与通用能力测试中,综合表现超越了阿里云的 Qwen3-30B-A3B-Thinking-2507 以及 OpenAI 开源的 GPT-OSS-20B,在相同或近似规模的开源模型中取得当前最佳(SOTA)成绩 。
尤其在编程场景中,GLM-4.7-Flash 在 SWE-bench 上取得了 59.2% 的高分,展现出强大的代码生成、调试与工具调用能力,被评价为“轻量级编程新标杆”。此外,模型在中文写作、翻译、长文本处理、情感表达及角色扮演等通用任务中也获得官方推荐 。

免费开源,无缝替代旧版
即日起,GLM-4.7-Flash 已在智谱开放平台 BigModel.cn 上线,并免费向公众开放调用。同时,该模型将全面替代上一代免费模型 GLM-4.5-Flash。值得注意的是,GLM-4.5-Flash 将于 2026 年 1 月 30 日正式下线,届时所有相关 API 请求将自动路由至 GLM-4.7-Flash,开发者需尽快更新模型调用代码以确保服务连续性 。
开源地址与本地部署支持
为便于开发者和研究者使用,智谱已将 GLM-4.7-Flash 模型权重公开托管于主流平台:
Hugging Face:
https://huggingface.co/zai-org/GLM-4.7-Flash
魔搭社区(ModelScope):
https://modelscope.cn/models/ZhipuAI/GLM-4.7-Flash
该模型支持本地部署,对硬件要求相对友好,适合在资源受限环境下运行高质量 AI 应用 。
综上所述,GLM-4.7-Flash 的发布不仅延续了智谱在开源大模型领域的技术领先优势,也为开发者提供了一个高效、免费且功能全面的轻量级 AI 引擎,有望在编程辅助、智能客服、内容创作等多个场景加速落地。