智谱AI开源新一代多模态大模型GLM-4.6V系列,强化视觉智能与工具调用能力

12.9 GLM-4.6V则以图像即参数,结果即上下文为核心理念,支持直接将图像截图或文档页面作为工具调用的输入参数,并能对工具返回的图表商品图片等视觉结果进行二次理解,无缝融入后续推理流程

12月8日,人工智能企业智谱AI正式发布并全面开源其最新多模态大模型系列——GLM-4.6V。该系列包含两个版本:面向云端与高性能集群的GLM-4.6V(106B-A12B)基础版,以及专为本地部署和低延迟场景优化的轻量级GLM-4.6V-Flash(9B)版本,后者已免费开放使用。


2025-12-09_143454_009

 

作为GLM系列在多模态领域的重大升级,GLM-4.6V将训练上下文窗口扩展至128K tokens,并在多项主流视觉理解基准(如MMBench、MathVista、OCRBench)中达到同参数规模下的领先水平(SOTA)。值得关注的是,该模型首次在架构层面原生集成Function Call(工具调用)能力,实现从“视觉感知”到“可执行行动”的完整闭环。

 

智谱AI强调,传统工具调用多依赖纯文本输入,处理图像、视频或复杂文档时需多次转换,易造成信息损失。GLM-4.6V则以“图像即参数,结果即上下文”为核心理念,支持直接将图像、截图或文档页面作为工具调用的输入参数,并能对工具返回的图表、商品图片等视觉结果进行二次理解,无缝融入后续推理流程。

 

在商业化方面,GLM-4.6V系列API调用价格较上一代GLM-4.5V大幅下调50%,定价低至输入1元/百万tokens、输出3元/百万tokens。同时,该模型已纳入“GLM Coding Plan”,针对八大典型应用场景开发了专用MCP工具,支持模型自主选择并调用最匹配的接口。


2025-12-09_143510_864

 

性能对比显示,9B参数的GLM-4.6V-Flash整体表现超越Qwen3-VL-8B;而106B总参数(12B激活)的GLM-4.6V则在关键能力上与参数量两倍于己的Qwen3-VL-235B相当,展现出显著的能效优势。此次发布标志着国产多模态模型在构建真实世界智能体(Agent)技术底座方面迈出关键一步。


2025-12-09_143745_281


https://github.com/zai-org/GLM-V 

https://huggingface.co/collections/zai-org/glm-46v 

https://modelscope.cn/collections/GLM-46V-37fabc27818446