MiniMax

公司介绍

MiniMax 是一家全球领先的通用人工智能科技公司,2022 年底成立,以「与所有人共创智能」为使命,致力于推动 AI 科技前沿发展,实现通用人工智能(AGI)。公司自主研发了一系列多模态通用大模型,具备强大的代码和 Agent 能力以及超长上下文处理能力,能够理解、生成并整合文本、音频、图像、视频和音乐在内的多种模态。

公司定位

  • 多模态原生:不是单一文本模型,而是文本、音频、图像、视频、音乐五大模态全栈
  • 长上下文领先:M3 模型支持 1M(100 万)token 上下文
  • Agent 能力突出:在 SWE-Bench Pro、Terminal Bench 等国际评测中表现领先
  • 开源 + 闭源双线:M3 是开源旗舰模型,商业产品走订阅制

核心模型

模型类型发布时间核心特点
MiniMax M3文本/Coding/Agent2026-06-01全新 MSA 稀疏注意力架构,1M 超长上下文,原生多模态,国内首个齐备这三个要素的模型,也是目前唯一的开源模型
MiniMax M2.5推理模型2026-02-12基于 MoE 架构,编程/智能体/生产力场景显著提升
MiniMax H3视频生成2026-07-31打破任务和模态的边界,更广泛的艺术和风格化能力
MiniMax Speech 2.8语音2026-01语音合成与理解
MiniMax Music 3.0音乐生成2026-08-13⚠️ 已停止服务(付费接口 08-20 起不面向新用户,免费接口全线关停),改用开源版

各模型的能力侧重

  • M3 是主力:日常 Coding、Agent 任务、长文档分析都用它
  • M2.5 是推理专精:数学竞赛、逻辑推理、复杂决策用 M2.5 更准
  • H3 是视频生成:文生视频、图生视频、视频风格化
  • Speech 2.8 是语音:TTS、ASR、语音克隆
  • Music 3.0 是音乐:作曲、编曲、纯音乐生成

订阅状态(2026-09-08 确认)

  • M3 包月不限量(老用户权益):用户的模型版图中承担「量大管饱」位——批量任务、长文档、不挑智力的量活零成本跑
  • 与 GLM-5.3-Flash、DeepSeek V4 Flash(API 按量付费)的分工:M3 管量、Flash 双子管质;包月模式能不能活,取决于模型本身行不行(MiMo V2.5 因模型差被弃,M3 因模型好续费)

M3 核心架构:MSA(MiniMax Sparse Attention)

M3 最重要的架构创新是全新稀疏注意力机制 MSA,它解决了全注意力机制计算复杂度平方级增长的「先天缺陷」。

什么是稀疏注意力

传统全注意力的问题:

  • 每个 token 都要和上下文里所有其他 token 计算相关性
  • 上下文越长,计算量平方级增长
  • 100 万 token 上下文下,计算量是 1K 的 100 万倍
  • 实际部署成本极高,跑不动

稀疏注意力的解决思路:

  • 不是所有 token 都需要两两相关
  • 大部分 token 只和「附近」的 token 关系强
  • 把注意力计算稀疏化,跳过不重要的 token 对

MSA 的独到之处

与 DSA 和 MoBA 等方案相比,MSA 可以更精确地为 KV 分块,实现更高的有效上下文覆盖。

全注意力:  每个 query 都和所有 KV 计算
DSA:        query 只和最近的 KV 块计算
MoBA:       query 选择性跳过某些 KV 块
MSA:        query 自适应选择 KV 块大小 + 命中区域

核心优化:

  • 在算子层直接优化,采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q
  • 每块只读一次、访存连续
  • 在 M3 的 head 配比下计算访存比显著优于通行方法
  • 比开源的 Flash-Sparse-Attention、flash-moba 快 4 倍以上

实际效果

在 100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。

阶段加速比
Prefilling(首次填充)超过 9 倍
Decoding(逐 token 生成)超过 15 倍
整体每 token 计算量上代模型的 1/20

而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平——既快又准,不是「快了但变笨」。

M3 能力评测

在涵盖软件工程、终端执行等多个维度的国际权威评测中,M3 均达到国际领先水平:

评测成绩说明
SWE-Bench Pro59.0%软件工程评测(修真实 GitHub Issue)
Terminal Bench 2.166.0%终端执行能力
SWE-fficiency34.8%代码效率
KernelBench Hard28.8%CUDA 算子
MCP Atlas74.2%MCP 工具调用

评测解读

  • SWE-Bench Pro 59%:是真实工程任务,比 SWE-Bench Verified 难得多,能修复杂 Issue
  • MCP Atlas 74.2%:工具调用能力突出,适合做 Agent
  • KernelBench Hard 28.8%:写 CUDA 算子的能力也强,能做 GPU 优化

实际任务表现

论文独立复现

M3 自主运行接近 12 小时,全程自主产出 18 次 commit 与 23 张实验图表,跑通了 ICLR 2025 Outstanding Paper Award 获奖论文 Learning Dynamics of LLM Finetuning 的核心实验。

成功吻合 SFT 阶段的预测概率变化趋势,观测到 DPO 实验的 squeezing 效应,验证了 Extend 缓解方法。

意义:一个 AI 能独立跑通获奖论文实验,意味着科研工作流可以大幅自动化。

CUDA 算子优化

在 NVIDIA Hopper 架构 GPU 上优化 FP8 GEMM kernel,M3 共完成 147 次 benchmark 提交、1959 次工具调用,自主走完 baseline 实现到生产级优化的全部路径。

最终将硬件峰值利用率从首版 7.6% 推进至 71.3%,实现 9.4× 加速。

横向对比:

  • 除 Opus 4.7 和 M3 外,其余模型大多在前 30 次提交内不再取得新进展并主动退出
  • M3 的最优解出现在第 145 次提交——证明它能持续探索不放弃
  • 只有 Opus 4.7 在这个任务上和它有可比性

让 M3 自己「训」模型

在 PostTrainBench 上,给 M3 四个只完成预训练的 Base 模型,让它在 12 小时内自主完成数据合成、训练、评测、迭代的全部流程。

最终得分 0.37,略低于 Opus 4.7(0.42)和 GPT-5.5(0.39),但明显领先其余模型。

意义:M3 不仅能调模型,还能自己造模型——这是 AGI 的关键能力。

产品矩阵

产品定位特点
MiniMax CodeCoding Agent专为 M3 设计并一起训练,Agent Team 可拆解大型任务为多阶段可并发 Workflow,Producer + Verifier 对抗式 Harness 循环,可自主运行数天。具备 Computer Use 能力,基于 OpenCode 和 Pi Agent 构建
MiniMax DesignAI 设计平台AI Agent 驱动的商业内容生产平台
MiniMax Audio语音产品语音合成与理解
星野C 端产品面向个人用户的应用

MiniMax Code 的特色

  • Agent Team:不是单个 Agent,而是多个 Agent 协作
  • Producer + Verifier 对抗:一个写代码,一个验证,互相博弈提升质量
  • 可运行数天:不像普通 Agent 几分钟就结束,Code 能跑几天不中断
  • Computer Use:能直接操作电脑 GUI,不只是命令行

Token Plan 三档

档位价格token 量折算
Plus¥49/月6 亿≈ Claude Pro $20 月度容量的 5 倍
Max¥119/月18 亿≈ Claude Max 5x $100 月度容量的 2 倍
Ultra¥469/月55 亿≈ Claude Max 20x $200 月度容量的 3 倍

按相同价格算,约是 Claude 订阅的 15 倍用量。

订阅档位选择建议

  • Plus ¥49/月:轻度用户,写写代码、查查资料
  • Max ¥119/月:中度用户,每天跑 Agent 任务
  • Ultra ¥469/月:重度用户,长链路 Agent、批量任务

API 计价(2026-10-01 官方核实)

当前主力已是 M2.7

⚠️ 重要变化:按量计费页面当前主推的是 MiniMax-M2.7(输入 ¥2.1 / 输出 ¥8.4 / 百万 tokens),M3 反而在「历史模型」之外单列。M2.7-highspeed 是高速版,价格翻倍(¥4.2 / ¥16.8)。

M3 价格(永久五折后)

M3 按输入上下文长度分两档,≤512k 部分永久五折:

模型输入(元/百万 tokens)输出(元/百万 tokens)缓存读取
M3 ≤512k 输入4.202.1016.808.400.840.42
M3 >512k 输入8.404.2033.6016.801.680.84
M2.72.18.40.42
M2.7-highspeed4.216.80.42
M2.5 / M2.1 / M2(历史)2.18.40.21

优先服务:service_tier=priority,按标准价 1.5 倍计费,换取优先准入和更低失败率。

估算参考:1600 个中文字符约消耗 1000 tokens。

其他产品线定价

产品单价
语音识别 ASR¥2.50 / 小时
语音合成 speech-2.8-turbo¥2.00 / 万字符
语音合成 speech-2.8-hd¥3.50 / 万字符
音色设计 / 快速复刻¥9.90 / 音色(首次使用才计费)
图像 image-01¥0.025 / 张
web_search 服务端工具¥0.03 / 次
API-vlm(Token Plan MCP)¥0.025 / 次

视频生成(MiniMax-H3)

模型分辨率单价
H3-Max480P¥0.33 / 秒
H3-Max768P¥0.50 / 秒
H3768P¥0.50 / 秒
H32K¥0.80 / 秒
H3-Context-IR—输入 ¥5.80 / 输出 ¥23.00 每百万 tokens

输入素材:音频免费、图片 5 张内免费(超出 ¥0.20/张)、视频按时长计费(2K ¥0.80/秒、768P ¥0.50/秒)。

⚠️ 音乐生成已全线停止服务

自 2026 年 8 月 20 日起:

  • 付费音乐生成、歌词生成接口不再面向新用户,历史付费用户可继续用
  • 免费音乐接口(Music-3.0-free、Music-2.6-free、music-cover-free)全部停止服务
  • 替代方案:去 MiniMax Audio 体验,或用 Hugging Face / ModelScope 上的开源 MiniMax Music 3

原表格里 Music 3.0 那行需要标注为已下线。

⚠️ 记账提醒

Token Plan 额度耗尽且已购积分可用时,超出部分会自动由已购积分补充支付(1,000 积分 = ¥7,与 API 按量付费 1:1)。这是静默扣费路径,用套餐 Key 时要留意超额消耗。

在国内大模型中的位置

模型公司上下文开源Agent 能力
M3MiniMax1M✅⭐⭐⭐⭐⭐
GLM-5.3智谱200K✅⭐⭐⭐⭐
Kimi K3月之暗面1M❌⭐⭐⭐⭐
DeepSeek V4DeepSeek128K✅⭐⭐⭐⭐

M3 在 Agent 能力和开源两方面都有优势,是国内 Coding Agent 首选之一。

相关笔记

相关日记