DeepSeek 和 Qwen 要小心了!开源大型语言模型 (LLM) 出现了一个新王者,尤其是在企业越来越重视的东西方面:代理工具的使用——即在没有太多人工指导的情况下使用其他软件功能(如网络搜索或定制应用程序)的能力。

该模型正是 MiniMax-M2,这是这家中国同名初创公司的最新大型语言模型。对于全球企业来说,这是一个巨大的胜利,该模型在宽松、企业友好的 MIT 许可证下可用,这意味着它可以免费供开发人员使用、部署、重新培训和使用他们认为合适的方式——甚至用于商业目的。它可以在 Hugging Face、GitHub 和 ModelScope 上找到,也可以通过 MiniMax 的 API 在这里找到。它还支持 OpenAI 和 Anthropic API 标准,使上述专有人工智能初创公司的客户可以根据需要轻松地将他们的模型转移到 MiniMax 的 API。
根据第三方生成式人工智能模型基准测试和研究机构 Artificial Analysis 的独立评估,M2 目前在智能指数(推理、编码和任务执行性能的综合衡量标准)方面在全球所有开放权重系统中排名第一。
在衡量模型规划、执行和使用外部工具(为编码助手和自主代理提供动力的技能)的代理基准测试中,MiniMax 自己报告的结果,遵循人工分析方法,显示 τ²-Bench 77.2、BrowseComp 44.0 和 FinSearchComp-global 65.5。
这些分数使其处于或接近 GPT-5(思维)和 Claude Sonnet 4.5 等顶级专有系统的水平,使 MiniMax-M2 成为迄今为止为现实世界代理和工具调用任务发布的性能最高的开放模型。
这对企业和人工智能竞赛意味着什么
MiniMax-M2 围绕高效的专家混合 (MoE) 架构构建,为代理和开发人员工作流程提供高端功能,同时保持企业部署的实用性。
对于技术决策者来说,此次发布标志着开放模型在商业环境中的一个重要转折点。MiniMax-M2 将前沿级推理与可管理的激活足迹相结合——总共 2300 亿个活动参数中只有 100 亿个。
这种设计使企业能够在更少的 GPU 上运行高级推理和自动化工作负载,实现近乎最先进的结果,而无需与专有前沿系统相关的基础设施需求或许可成本。
Artificial Analysis 的数据显示,MiniMax-M2 的优势超出了原始智能分数。该模型在端到端编码、推理和代理工具使用基准测试中领先或紧随其后,例如 GPT-5(思维)和 Claude Sonnet 4.5 等顶级专有系统。
它在τ²-Bench、SWE-Bench和BrowseComp中的性能表明,对于依赖能够规划、执行和验证复杂工作流程的AI系统的组织来说,这些系统具有特殊的优势,这些系统是企业环境中代理和开发人员工具的关键功能。
正如大语言模型工程师 Pierre-Carl Langlais 又名 Alexander Doria 在 X 上发布的那样:“MiniMax [正在] 为端到端掌握该技术以获得实际的代理自动化提供了理由。
紧凑的设计,可扩展的性能
MiniMax-M2 的技术架构是一个稀疏的 Mix-of-Expert 模型,总参数为 2300 亿个,每次推理有 100 亿个活动参数。
此配置显着降低了延迟和计算要求,同时保持了广泛的通用智能。
该设计允许响应式代理循环(编译-运行-测试或浏览-检索-引用循环),与更密集的模型相比,它们执行得更快、更可预测。
对于企业技术团队来说,这意味着更容易扩展、降低云成本并减少部署摩擦。 根据 Artificial Analysis 的数据,该模型可以在只需四个 NVIDIA H100 GPU 上以 FP8 精度高效提供,对于中型组织或部门 AI 集群来说,这种设置是完全可以实现的。
Benchmark Leadership跨代理和编码工作流程
MiniMax 的基准测试套件突出了开发人员和代理环境中强大的实际性能。下图与该模型一起发布,将 MiniMax-M2(红色)与几个领先的专有和开放模型进行了比较,包括 GPT-5(思考)、Claude Sonnet 4.5、Gemini 2.5 Pro 和 DeepSeek-V3.2。
2025 年 10 月,跨编码和代理任务的 MiniMaxAI 基准比较。图片来源:MiniMax
MiniMax-M2 在许多类别中都取得了顶级或接近顶级的性能:
SWE-bench 验证:69.4 — 接近 GPT-5 的 74.9
ArtifactsBench:66.8 — 高于 Claude Sonnet 4.5 和 DeepSeek-V3.2
τ²-Bench:77.2 — 接近 GPT-5 的 80.1
GAIA(仅文本):75.7 — 超越 DeepSeek-V3.2
BrowseComp:44.0 — 明显强于其他开放模型
FinSearchComp-global:65.5 — 在经过测试的开放重量系统中表现最佳
这些结果表明 MiniMax-M2 能够跨多种语言和环境执行复杂的工具增强任务,这些技能与企业内部的自动化支持、研发和数据分析越来越相关。
在 Artificial Analysis 的智能指数中表现强劲
该模型的整体智能概况在最新的 Artificial Analysis 智能指数 v3.0 中得到证实,该指数汇总了十个推理基准的性能,包括 MMLU-Pro、GPQA Diamond、AIME 2025、IFBench 和 τ²-Bench Telecom。
Artificial Analysis Intelligence Index v3.0, 2025 年 10 月 图片来源:Artificial Analysis
MiniMax-M2 得分为 61 分,是全球开放权重最高的模型,紧随 GPT-5(高)和 Grok 4 之后。
Artificial Analysis 强调了该模型在技术准确性、推理深度和跨领域应用智能之间的平衡。对于企业用户来说,这种一致性表明可靠的模型基础适合集成到软件工程、客户支持或知识自动化系统中。
专为开发人员和代理系统设计
MiniMax 为端到端开发人员工作流程设计了 M2,可直接在集成开发环境或 CI/CD 管道中实现多文件代码编辑、自动化测试和回归修复。
该模型在代理规划方面也表现出色——处理结合 Web 搜索、命令执行和 API 调用的任务,同时保持推理可追溯性。
这些功能使得 MiniMax-M2 对于探索自主开发代理、数据分析助手或人工智能增强运营工具的企业特别有价值。
Terminal-Bench 和 BrowseComp 等基准测试证明了该模型能够适应不完整的数据并从中间错误中优雅地恢复,从而提高生产设置的可靠性。
交错思维和结构化工具使用
MiniMax-M2 的一个独特之处在于其交错式思维格式,它在<think>...</think> 标签。
这使模型能够跨多个交换规划和验证步骤,这是代理推理的关键功能。MiniMax 建议在传递对话历史记录时保留这些片段,以保留模型的逻辑和连续性。
该公司还提供了关于 Hugging Face 的工具调用指南,详细介绍了开发人员如何通过结构化的 XML 风格调用连接外部工具和 API。
这一功能使得MiniMax-M2能够作为大型智能体框架的推理核心,通过外部函数执行搜索、检索和计算等动态任务。
开源访问和企业部署选项
企业可以通过MiniMax开放平台API和MiniMax Agent界面(类似于ChatGPT的网络聊天)访问该模型,目前两者都在有限的时间内免费。
MiniMax 推荐 SGLang 和 vLLM 以实现高效服务,每个都为模型独特的交错推理和工具调用结构提供第一天支持。
部署指南和参数配置可通过 MiniMax 的文档获得。
成本效率和代币经济学
正如 Artificial Analysis 所指出的,MiniMax 的 API 定价设定为每百万输入代币 0.30 美元和每百万输出代币 1.20 美元,是开放模型生态系统中最具竞争力的。
供应商 | 模型(链接) | 输入 $/1M | 输出 $/1M | 说明 |
MiniMax | $0.30 | $1.20 | 列在 M2 的“Completion v2”下。 | |
OpenAI | $1.25 | $10.00 | OpenAI 的 API 定价页面上的旗舰模型定价。 | |
OpenAI | $0.25 | $2.00 | 用于明确定义的任务的更便宜的层。 | |
Anthropic | $3.00 | $15.00 | Anthropic 当前的 per-MTok 列表;long-context(>200K 输入)使用高级层。 | |
$0.30 | $2.50 | 价格包括“思考代币”;页面还列出了更便宜的 Flash-Lite 和 2.0 层。 | ||
xAI | $0.20 | $0.50 | “快速”层;xAI 还以 3 美元/15 美元的价格列出了 Grok-4。 | |
DeepSeek | $0.28 | $0.42 | 缓存命中输入为 0.028 美元;表显示每个模型的详细信息。 | |
Qwen (Alibaba) | from $0.022 | from $0.216 | 按输入大小分层(≤128K、≤256K、≤1M 代币);列出“每 1M 的输入价格/输出价格”。 | |
Cohere | $2.50 | $10.00 | 第一方定价页面还列出了 Command R(0.50 美元/1.50 美元)等。 |
注意事项(读者):
价格为每百万代币美元,可能会发生变化;检查链接页面的更新和区域/端点的细微差别(例如,Anthropic 长上下文>200K 输入、Google Live API 变体、缓存折扣)。
供应商可能会为服务器端工具(Web 搜索、代码执行)收取额外费用或提供批处理/上下文缓存折扣。
虽然该模型会产生更长、更明确的推理跟踪,但其稀疏激活和优化的计算设计有助于保持良好的成本效益平衡,这对于部署交互式代理或大容量自动化系统的团队来说是一个优势。
MiniMax 的背景——中国新兴巨头
MiniMax 已迅速成为中国快速崛起的人工智能领域最受关注的公司之一。
在阿里巴巴和腾讯的支持下,该公司在一年内从相对默默无闻到国际认可——首先是人工智能视频生成方面的突破,然后是一系列直接针对开发人员和企业的开放权重大型语言模型 (LLM)。
该公司于 2024 年底凭借其人工智能视频生成工具“video-01”首次引起全球关注,该工具展示了在几秒钟内创建动态电影场景的能力。VentureBeat 描述了在线创作者开始分享逼真的人工智能生成镜头后,该模型的推出如何引发了广泛的兴趣——最令人难忘的是,一段星球大战光剑决斗的病毒片段在不到两天的时间内吸引了数百万次观看。
首席执行官闫俊杰强调,该系统在生成人类运动和表达方面优于西方领先的工具,这是视频人工智能经常遇到困难的领域。该产品后来通过 MiniMax 的 Hailuo 平台实现商业化,展示了这家初创公司的技术信心和创意影响力,帮助中国成为生成视频技术领域的有力竞争者。
到 2025 年初,MiniMax 将注意力转向长上下文语言建模,推出了 MiniMax-01 系列,包括 MiniMax-Text-01 和 MiniMax-VL-01。这些开放权重模型引入了前所未有的 400 万令牌上下文窗口,使谷歌的 Gemini 1.5 Pro 的覆盖范围翻了一番,使 OpenAI 的 GPT-4o 相形见绌了 20 倍以上。
该公司继续快速发展,于 2025 年 6 月发布了 MiniMax-M1,该模型专注于长上下文推理和强化学习效率。M1 将上下文容量扩展到 100 万个令牌,并引入了使用称为 CISPO 的自定义强化学习算法训练的混合专家混合设计。值得注意的是,VentureBeat 报道称,MiniMax 训练 M1 的总成本约为 534,700 美元,大约是 DeepSeek R1 的十分之一,远低于前沿规模模型典型的数百万美元预算。
对于企业和技术团队来说,MiniMax 的发展轨迹标志着新一代经济高效、开放重量模型的到来,专为实际部署而设计。其开放许可(从 Apache 2.0 到 MIT)使企业能够自由定制、自托管和微调,而不受供应商锁定或合规性限制。
结构化函数调用、长上下文保留和高效注意力架构等特性直接满足了工程团队管理多步推理系统和数据密集型管道的需求。
随着 MiniMax 不断扩大其产品阵容,该公司已成为开放式人工智能领域的全球重要创新者,将雄心勃勃的研究与务实的工程相结合。
开放式领导力和行业背景
MiniMax-M2 的发布加强了中国人工智能研究团队在开放权重模型开发方面日益增长的领导地位。
继 DeepSeek、阿里巴巴的 Qwen 系列和 Moonshot AI 的早期贡献之后,MiniMax 的进入延续了专为现实世界使用而设计的开放、高效系统的趋势。
Artificial Analysis 观察到,MiniMax-M2 体现了对智能体能力和强化学习改进的更广泛转变,优先考虑可控推理和实际效用,而不是原始模型大小。
对于企业来说,这意味着可以访问最先进的开放模型,该模型可以在内部完全透明地进行审计、微调和部署。
通过将强大的基准性能与开放许可和高效扩展相结合,MiniMaxAI 将 MiniMax-M2 定位为智能系统的实用基础,这些系统通过可追溯逻辑进行思考、行动和协助,使其成为当今最企业级的开放式 AI 模型之一。