2026年6月1日,国内AI独角兽MiniMax(稀宇科技)正式发布了新一代旗舰大模型 MiniMax M3。这款模型被官方定位为首个同时具备"前沿编程与智能体能力、百万级上下文、原生多模态"三大核心能力的国产开源旗舰,直接对标GPT-5.5、Claude Opus 4.7和Gemini 3.1 Pro等海外闭源顶级模型。
一、三大核心能力:打破海外垄断的"三合一"旗舰
1. 前沿编程与智能体能力:代码直接可交付
MiniMax M3在编码能力上达到了行业顶尖水平。在衡量真实软件工程能力的 SWE-Bench Pro 评测中,M3得分超越GPT-5.5和Gemini 3.1 Pro,接近Claude Opus 4.7;在 Terminal Bench 2.1 中更是以66.0分领先Opus 4.7(64.1)和GPT-5.5(58.6)。

官方强调,M3写出的代码目标是"直接可交付",而非"能跑但需要人改"。在 BrowseComp 智能体评测中,M3以83.5分超越Opus 4.7(79.3),展现出强大的自主浏览与信息检索能力。
一个极具说服力的实测案例是:MiniMax将一篇ICLR 2025杰出论文交给M3独立复现。M3连续运行近12小时,全程自主产出18次commit与23张实验图表,成功跑通核心实验。多模态能力让它能看懂论文中的图表公式,百万上下文保证论文+代码+实验日志一次性进入窗口,编程+Agent能力驱动长线程执行。

2. 百万级上下文:1M tokens的"长程基础设施"
基于自研的MiniMax Sparse Attention(MSA) 架构,M3的API最高支持 1M tokens上下文窗口,并保障至少512K tokens可用。官方明确表示,1M上下文是长程Agent、长程Coding、长视频理解的"基础设施"。
MSA架构通过Index Branch快速索引与Sparse Branch精准计算相结合的方式,解决了传统Transformer在处理百万Token时计算复杂度呈平方级增长的瓶颈。相比前代M2,M3在Prefill阶段实现9.7倍加速,Decoding阶段实现15.6倍加速;在1M上下文下,每Token计算量仅为上代模型的1/20。
这一效率跃升意味着,企业处理百万Token级别长文档的算力成本可降低80%以上,个人用户进行超长对话时响应几乎无延迟。
3. 原生多模态:从"第零步"开始的视觉对齐
M3是原生多模态模型,重构了整个数据管线,将预训练数据规模扩充至百T量级,从第零步开始多模态训练,使文本和视觉语义空间高度对齐。在 OmniDocBench 多模态测试集上,M3得分超过Gemini 3.1 Pro;在 SVG-Bench 综合评测中,M3以63.7分超越Opus 4.7(62.3)。
二、架构创新:MSA——工程先行的"极简主义"
M3的核心架构创新在于MiniMax Sparse Attention(MSA),这是一种简洁且易于扩展的全新稀疏注意力架构。
与传统稠密注意力机制相比,MSA的设计体现了"工程先行"的理性权衡:
GQA底层而非MLA:采用分组查询注意力(GQA),意味着vLLM、SGLang和FlashAttention的核函数可以几乎零修改地复用,无需为隐式KV进行复杂工程改造。
块级选择,真实KV计算:与在压缩后KV上计算注意力的方案不同,M3保留了Softmax注意力的全部表达能力,用Token经济性换取模型质量。
单分支极简设计:相比DeepSeek NSA的三路并行(压缩+选择+滑窗)+学习型门控,M3仅保留选择分支,砍掉了冗余组件,追求"能立即运行、运行速度快"的实用主义。
在算子层,MSA采用以KV块为外层来聚合命中query的KV outer gather Q,每块只读一次、访存连续,计算访存比显著优于通行方法,比开源的Flash-Sparse-Attention、flash-moba快4倍以上。
三、极限实测:24小时无人干预,FP8利用率从7.6%飙至71.3%
M3在极限任务中展现了极强的长线程自主规划力。除了12小时复现ICLR论文外,M3还在无参考代码的情况下连续运行24小时、调用工具近2000次,将Hopper架构上的FP8矩阵乘硬件利用率从7.6%提升至71.3%。
在 PostTrainBench 开放式评测中,M3被给予四个仅完成预训练的Base模型,要求在12小时内自主完成数据合成、训练、评测、迭代全流程。全程无人干预下,M3最终得分37.1,位列第三,仅次于Opus 4.7(42.4)和GPT-5.5(39.3)。
四、开源与定价:打破"高价垄断"的性价比革命
即将全面开源
MiniMax承诺 M3即将在HuggingFace和GitHub上完成开源,支持私有集群部署和微调。这将使其成为国内首个齐备"前沿编程+百万上下文+原生多模态"三要素的开源模型,打破此前由海外闭源模型垄断的前沿能力格局。
极具竞争力的API定价
M3提供标准版和高速版(M3-highspeed)两个版本API,结果完全一致,后者速度更快。全面支持自动Cache,无需设置,自动生效。
上下文≤512K限时五折价格:
输入:标准版 2.1元/百万tokens,优先版3.15元
输出:标准版 8.4元/百万tokens,优先版12.6元
缓存读取:标准版 0.42元/百万tokens,优先版0.63元
这一价格水平与海外旗舰形成鲜明对比。作为参考,Claude Opus 4.6的输入定价约为15美元/百万tokens(约108元人民币),输出高达75美元(约540元人民币)。 MiniMax的定价策略延续了其"高性价比优先"的竞争路线——据高盛数据,MiniMax当前文本API毛利率约40%,显著高于行业平均的20%-25%。
Token Plan订阅升级
同步升级的Token Plan采用基于积分的用量扣减机制,覆盖Plus(¥49/月)、Max(¥119/月)和Ultra(¥469/月)三档。核心变化包括按实际资源消耗折算积分、统一额度池、用量进度条直观展示等。老套餐用户还将获得一次性补偿积分。
五、行业意义:从"参数竞赛"到"效率竞赛"的转折点
MiniMax M3的发布,标志着国产大模型竞争进入新阶段:
技术层面,M3证明了通过架构创新(而非单纯堆参数)可以实现前沿能力。其MSA架构与DeepSeek的NSA、小米的HySparse等共同构成了国产稀疏注意力技术矩阵,推动行业从"参数规模竞赛"转向"效率与实用性竞赛"。
商业层面,M3的发布正值MiniMax商业化加速期。公司ARR自2月以来已实现翻倍增长,开放平台/API收入占比从2025年末的30%上升至目前的超过50%。 摩根士丹利等机构给予"超配"评级,认为M3系列将带来"重大智能突破"。
生态层面,M3的开源承诺将极大降低开发者使用前沿多模态和长上下文能力的门槛。在2026年的技术图谱中,1M上下文正从一个"卖点"转变为"基准线",而MiniMax以全要素开源的形式,正在重塑国内开发者生态的性价比边界。
结语
MiniMax M3的登场,不仅是一款模型的迭代,更是国产AI在"智能密度"时代的一次宣言。当海外闭源模型仍在高价垄断前沿能力时,M3以开源之姿、架构之新、价格之优,证明了国产大模型已经具备定义行业标准的能力。随着HuggingFace和GitHub上的权重即将开放,这场由MSA架构驱动的"效率革命",或将深刻改变全球AI开发者的工具选择。