上海AI独角兽企业MiniMax于6月17日正式发布其自主研发的MiniMax-M1系列模型,该模型被定义为"全球首个开源的大规模混合架构推理模型",在长文本处理能力、训练成本和推理效率等多个维度实现了突破性进展。这一发布标志着中国AI企业在开源大模型领域迈出了重要一步,也为全球开发者提供了高性能、低成本的AI基础设施选择。

突破性技术:百万级上下文窗口与高效混合架构
MiniMax-M1最引人注目的技术突破是其原生支持100万Token的上下文窗口,这一数字与谷歌最新的Gemini 2.5 Pro持平,远超当前多数主流大模型。同时,M1还支持业内最长的8万Token推理输出能力,使其在长文档处理、复杂代码生成和多轮对话等场景中展现出独特优势。
实现这一突破的关键在于MiniMax独创的"Lightning Attention"混合架构。传统Transformer模型在处理长序列时,注意力机制的计算量会随序列长度呈平方级增长,成为制约性能和成本的主要瓶颈。M1采用的混合专家架构(MoE)与线性注意力机制相结合,显著优化了长上下文输入的计算效率。
据技术报告显示,M1模型总参数达4560亿,每个token激活约45.9亿参数,通过MoE架构实现高效计算。这种设计不仅理论上能够高效地将推理长度扩展到数十万token,还带来了计算成本的大幅下降,使M1在训练和推理时都具备显著的算力效率优势。
训练成本革命:仅53万美元创造行业新标杆
MiniMax-M1在成本控制方面树立了行业新标杆。根据公司披露,M1的整个强化学习阶段仅使用了512块英伟达H800 GPU,耗时三周,总成本仅为53.5万美元。这一数字相比DeepSeek R1的500-600万美元训练成本和OpenAI GPT-4的超1亿美元训练成本,堪称"平价奇迹"。
这一成本突破主要归功于MiniMax自主研发的CISPO(Clipped IS-weight Policy Optimization)算法。该算法通过裁剪重要性采样权重而非传统算法中调整Token的更新方式,提升了强化学习的效率和稳定性。技术报告显示,CISPO算法的收敛性能比字节跳动近期提出的DAPO算法快一倍,也优于DeepSeek早期使用的GRPO算法。
"这一成本比最初的预期少了一个数量级",MiniMax官方表示,展示了其技术路线在成本控制上的巨大潜力。数字经济学者、工信部信息通信经济专家委员会委员盘和林评价称,CISPO算法是对传统PPO/GRPO裁剪方式的优化,目的正是为了降低训练和推理成本。
卓越性能:多项基准测试超越行业领先者
在性能表现方面,MiniMax-M1在多个核心生产力场景中展现出比肩甚至超越业界顶尖模型的实力。技术报告显示,M1在工具使用场景(TAU-bench)中,MiniMax-M1-40k版本的表现超过了谷歌Gemini-2.5 Pro。
MiniMax对M1进行了全面的基准测试,覆盖17个主流评测集。结果显示:
在数学竞赛基准AIME 2024上,M1-80k模型达到86.0%的准确率
在编码能力方面,M1-40k和M1-80k版本分别取得了55.6%和56.0%的成绩,稳居第一梯队
在长文本理解任务中,依托百万级上下文窗口,M1系列表现惊艳
在模拟真实世界工具调用的复杂场景中,M1-40k模型领跑开源模型

与竞争对手相比,M1在生成10万token长度时,仅消耗DeepSeek R1所需浮点运算(FLOPs)的25%。在进行8万Token的深度推理时,M1所需的算力仅为DeepSeek R1的约30%。这种高效的推理能力使M1在实际应用中具备显著的性价比优势。
开源策略与定价:推动AI技术民主化
MiniMax宣布M1采用Apache 2.0许可证完全开源,企业可无限制地将其用于商业应用并根据需要进行修改,无需付费。模型权重和技术报告已上架Hugging Face和GitHub平台。这一举措不仅挑战了DeepSeek等中国AI企业的开源模型,也为全球AI生态注入了新的活力。
在商业化方面,MiniMax为M1设计了**阶梯式定价策略**,随着输入文本长度增加而提高:
0-32k Token:输入0.8元/百万Token,输出8元/百万Token
32k-128k Token:输入1.2元/百万Token,输出16元/百万Token
128k-1M Token:输入2.4元/百万Token,输出24元/百万Token
前两个档位的定价均低于DeepSeek-R1,而第三个超长文本档位则是DeepSeek模型目前尚未覆盖的领域。此外,MiniMax方面表示,在其自有的App和Web端,M1模型将保持不限量免费使用。
天使投资人、资深人工智能专家郭涛分析认为,此次MiniMax更新填补了开源领域长上下文技术的空白,更以"开源+场景化"路径打破技术垄断,为国产大模型迈向实用化树立新标杆。
行业影响:大模型竞争进入新阶段
MiniMax-M1的发布正值中国大模型市场竞争白热化的关键时期。年初DeepSeek的爆火出圈后,其带来的技术革新与成本降低,拉动了行业"技术平权",更将压力传到其它大模型厂商。在DeepSeek影响下,被称为大模型"六小虎"的创业公司商业化路径和融资变得极具挑战。
面对这一局面,各家AI企业纷纷调整战略:
零一万物在年初调整策略,将大部分训练和AI基础设施团队并入阿里,不再追求训练超级大模型
百川智能则精简B端业务,声称要聚焦AI医疗大模型
Kimi、智谱、阶跃星辰选择留在通用人工智能的赛道,相继上线了自研推理模型
MiniMax此次发布并开源推理模型,预示其做好了准备,将继续加入这场大模型之争中。据《科创板日报》记者获悉,M1的发布仅是MiniMax"开源周"的序幕。在接下来的四个工作日里,MiniMax计划每天发布一项新的技术或产品更新。
当前,大模型的竞争格局还面临新的变数——DeepSeek R2的发布。今年以来,DeepSeek对V3模型和R1模型进行了小版本试升级,但DeepSeek R2模型何时发布,迟迟未有消息。这不仅对DeepSeek自身意义重大,也是现有大模型玩家所面临的一场竞争考验。
盘和林表示看好加码大模型的创业公司:"现阶段的基础模型依然有很大的提升空间...谁找对了大模型算法优化的方向,谁就是下一个科技巨头。DeepSeek向前走了一步,但还不够。"这一观点揭示了当前AI行业的核心竞争逻辑——技术创新与成本控制的双重突破将决定企业的市场地位。
未来展望:AI Agent与行业应用
MiniMax-M1的高效架构将在未来智能体应用中具有独特优势。"未来智能体需要数十到数百个回合进行推理,同时整合来自不同来源的长上下文信息,"该公司表示。目前,MiniMax正在海外内测智能体应用,主打代码、多模态等能力。
今年1月,MiniMax创始人兼CEO闫俊杰在接受媒体采访时便明确表示,现在MiniMax最重要的目标不是增长,也不是收入,是"加速技术迭代"。他认为,更好的模型可以导向更好的应用,但更好的应用和更多用户并不会导向更好的模型。这一战略导向使得MiniMax能够集中资源突破核心技术瓶颈。
国泰海通证券在近期的研报中提及,大模型在多模态理解和复杂推理上的突破,为AI Agent的发展提供了核心技术支撑。AI应用虽尚处于落地初期,但未来发展路径明晰,当前处于B端萌芽期,未来C端有望大规模爆发,最终将实现B端与C端并行发展,全面推动AI产业繁荣。
MiniMax-M1的发布,不仅是一次技术突破的展示,更是中国AI企业在全球开源生态中的重要贡献。其超长上下文处理能力、极低训练成本和高效推理性能,为法律文档分析、代码库理解、医疗文献研究等需要处理百万级token的场景提供了极具吸引力的解决方案。随着AI技术向各行各业渗透,像M1这样兼顾性能与成本的开源模型,有望加速AI技术的规模化应用,推动产业智能化进程。