12月22日,中国大模型厂商智谱AI正式开源其最新旗舰模型 GLM-4.7,引发全球技术社区广泛关注。与以往单纯聚焦“大参数”或“多模态”的路线不同,GLM-4.7以“智能体化能力”为核心,系统性重构了模型的推理、编码与工具协同机制,被业内称为“最像程序员的开源大模型”。
从“写代码”到“做工程”:编码能力完成范式跃迁
GLM-4.7并非仅在代码生成速度或语法正确性上做出提升,而是将模型定位为“具备工程思维的智能体”。在权威编程基准 SWE-bench Verified 中,其得分达到73.8%,较前代提升5.8个百分点,刷新开源模型纪录;在多语言支持的 SWE-bench Multilingual 测试中更是跃升12.9个百分点至66.7%。这意味着 GLM-4.7 不仅能写 Python,还能在真实软件仓库中定位 Bug、理解上下文、提交修复方案。

更令人瞩目的是其在终端任务(Terminal Bench 2.0)中得分41.0%,较上一代暴涨16.5%。这表明模型已能理解并执行复杂的命令行操作链,如创建虚拟环境、运行测试、部署服务等,真正迈入“端到端开发助手”阶段。

推理升级:三大“思考模式”重构人机协作逻辑
GLM-4.7在推理架构上的创新尤为突出,首次系统整合“交错式思考”“保留式思考”与“轮级思考”三大机制:
交错式思考:模型在调用工具后,会基于返回结果继续推理,而非机械执行下一条指令;
保留式思考:在多轮对话中自动缓存中间推理过程,避免重复计算、信息丢失,显著提升长程任务一致性;
轮级思考:用户可按轮次动态开启或关闭深度推理,在“快速问答”与“复杂规划”之间灵活切换,兼顾效率与精度。
这种分层控制机制让模型在数学推理(AIME2025)、科学问答(GPQA-Diamond 85.7)等高难度任务中表现稳健,同时也优化了日常使用时的响应速度与成本。
不止于程序员:全场景能力同步进化
尽管以编程为突破口,GLM-4.7并未牺牲通用能力。在前端开发、PPT生成、3D建模等创意场景中,其输出结构更清晰、视觉元素更合理,展现出对空间关系与设计规范的理解力。在角色扮演、多轮对话等交互任务中,128K上下文支持与低幻觉率保障了长时间会话的连贯性与可靠性。
此外,模型已兼容 vLLM、SGLang 等主流推理框架,支持本地部署与企业私有化集成,大幅降低应用门槛。
开源+低价:智谱的“双轮驱动”战略
在技术发布的同时,智谱同步推出“节日限定”订阅计划:月费最低20元即可使用 GLM-4.7,提供相当于 Claude Pro 三倍的调用量。这一策略既吸引个人开发者和初创团队,也为即将到来的港交所IPO铺路——GLM-4.7或将成为其上市前最重要的技术名片。
结语:从“模型”到“智能体”的临界点
GLM-4.7的发布,标志着开源大模型正从“被动应答”向“主动执行”演进。它不再只是一个语言预测器,而是一个能规划、能调用、能迭代的数字智能体。在编程成为AI基础设施的今天,GLM-4.7或许正引领一场“人人皆可成为产品工程师”的新范式革命。