AI 快讯 | MiniMax 上线 M3.1-Flash-Preview:1M 上下文+可调思考深度,且思考无法关闭

:fire: 一句话核心:MiniMax 在官方 API 文档中上线 MiniMax-M3.1-Flash-Preview——官方描述为「frontier multimodal coding model with 1M context window and tunable thinking depth」(前沿多模态编码模型,100 万上下文,可调思考深度),目前「only through Token Plan and MiniMax Code」(只经 Token Plan 与 MiniMax Code 提供,未开放普通 API 调用)。:warning: 与旗舰 MiniMax-M3 相比,官方文档里唯一的功能差异就是「可调思考深度」——上下文、多模态、前沿编码三项特性两者相同;官方同时明确该模型的思考无法关闭。

MiniMax 官方文档「Models」页:提示 M3.1-Flash-Preview 目前仅经 Token Plan 与 MiniMax Code 提供;下方模型表并列 MiniMax-M3.1-Flash-Preview(Frontier multimodal coding model with 1M context window and tunable thinking depth)与 MiniMax-M3(1M context window),特性栏前者多出 Tunable thinking depth(来源:platform.minimax.io/docs/guides/models-intro)


:pushpin: 背景脉络

  • 这是 MiniMax M 系列的一次「Flash 预览版」放量。按官方文档给出的谱系(含 Legacy 表):
模型 上下文窗口(官方文档)
MiniMax-M2 204,800(官方另注 max output 128k,含 CoT)
MiniMax-M2.1/M2.1-highspeed 204,800(官方注:230B 总参数、每次推理激活 10B)
MiniMax-M2.5/M2.5-highspeed 204,800
MiniMax-M2.7/M2.7-highspeed 204,800
MiniMax-M3 1,000,000
MiniMax-M3.1-Flash-Preview 1,000,000
  • 行业位置:与本站已发的国产模型发布线同族——topic 152(千问 Qwen3.8-Omni-Flash)、topic 153(智谱 GLM-5.3-FlashX)、topic 162(阶跃 Step 5 Preview)。本条真正的差异不在参数,而在「先在自家开发工具内放量、暂不开放普通 API」这个节奏。
  • 时间::warning: 官方文档页未标注发布日期;「2026-09-27 上线」来自媒体报道。

:key: 关键细节(官方 API 文档原文)

一、可用范围(这是本条最硬的一条)

「MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now.」

⇒ 它不是普通的按量 API 模型:官方在文档顶部反复提示这一点,并把取密钥的入口指向 Token Plan 订阅控制台。

二、可调思考深度(官方称其为该模型的核心新增能力)

  • 参数 effort 接受 low、medium、high、xhigh、max;档位越高思考越充分,输出 token 更多、延迟更高。
  • 省略 effort 时默认 max。
  • 字段名随协议不同:Anthropic 兼容协议用 output_config.effort(思考内容在 thinking 块);OpenAI 兼容协议用 reasoning_effort(思考内容在 reasoning_content 字段);OpenAI Responses 协议用 reasoning.effort。

三、思考默认开启,而且关不掉

「Thinking is on by default and needs no configuration.」

「Thinking cannot be turned off. Sending thinking: {"type": "disabled"} or effort: "none" returns 400:」

model "MiniMax-M3.1-Flash-Preview" requires adaptive thinking

官方给出的替代做法是:要降低延迟与 token 消耗,就调低 effort 档位,而不是试图关闭思考。

四、接入方式

字段 值(官方文档)
base_url(Anthropic 兼容,官方推荐) https://api.minimax.io/anthropic
base_url(OpenAI 兼容) https://api.minimax.io/v1

官方称 Anthropic 兼容路径「supports thinking blocks, interleaved thinking, and other advanced features — this is the default path」。

MiniMax 官方文档「Thinking depth (effort)」与「Limitations」两节:effort 接受 low/medium/high/xhigh/max、省略时默认 max;限制一节写明思考无法关闭,发送 thinking:{"type":"disabled"} 或 effort:"none" 会返回 400,报错原文为 model "MiniMax-M3.1-Flash-Preview" requires adaptive thinking(来源:platform.minimax.io/docs/guides/text-generation)


:bar_chart: 数据解读与口径

一、:warning: 与 M3 的官方差异只有一项——不要在标题或正文里把它写成「新旗舰」

官方文档的模型描述是逐字的:

MiniMax-M3.1-Flash-Preview MiniMax-M3
描述原文 Frontier multimodal coding model with 1M context window and tunable thinking depth Frontier multimodal coding model with 1M context window
特性栏 Multimodal/1M context window/Frontier coding/Tunable thinking depth Multimodal/1M context window/Frontier coding
上下文窗口 1,000,000 1,000,000

⇒ 官方口径下,M3.1-Flash-Preview 相对 M3 唯一多出来的是「可调思考深度」,其余三项完全相同。本文不把它写成「1M 新模型」或「M3 的升级旗舰」。

二、日期只能按「官方文档未标日期」写

官方文档页不带发布日期(这与我们既有的纪律一致:文档类页面常不带日期,不得据抓取时间推定为「今日」)。⇒ 正文写「2026-09-27(据媒体;官方文档未标日期)」。

三、:warning: 不要拿 M3 的成绩当作 M3.1-Flash-Preview 的

MiniMax 的 M3 产品页(minimax.io/models/text/m3)有一整块 M3 的 benchmark 图表,并写「The first open-weight model with three frontier capabilities」「On BrowseComp, M3 scores 83.5, surpassing Opus 4.7 (79.3)」等——这些全部是 M3 的成绩,官方没有为 M3.1-Flash-Preview 发布任何基准分数。⇒ 两者不可混用。

四、参数:官方没给 M3/M3.1 的参数量

官方文档只在 M2.1 的条目里写了「230B total parameters with 10B activated per inference」;M3 与 M3.1-Flash-Preview 的参数量、训练数据、架构均未在文档中给出。⇒ 不要自行补参数。


:money_bag: 价格与成本

  • :warning: 官方文档未公布 MiniMax-M3.1-Flash-Preview 的单价,也未给出计费单位——唯一线索是可用范围被限定在 Token Plan(订阅) 与 MiniMax Code,取密钥的按钮指向订阅控制台。本文不引用任何媒体转述的价格。
  • 成本上真正需要注意的是「思考关不掉」这件事:既然思考默认开启且默认档位是 max,同一个简单请求的 token 消耗与延迟会显著高于可关闭思考的模型;官方给出的唯一调节手段是显式把 effort 调低。⇒ 做成本估算时,务必显式设置 effort,不要依赖默认值。
  • 据媒体报道,9 月 28 日至 10 月 7 日在 MiniMax Code 内有每日签到双倍积分活动(新老用户均可参与)——:warning: 该活动我未在官方页面取到,标注为「据媒体报道」。

:balance_scale: 辩证评估

为什么值得跟:

  • 1M 上下文 + 多模态(文本/图像/视频)+ 编码的规格组合,对长代码库、长文档、多轮 agent 会话是有意义的;
  • 可调思考深度在工程上确实有用:同一模型可以在「快速改 bug」和「复杂重构」之间切换档位,而不必换模型;
  • Anthropic 兼容协议是推荐路径,对已经用 Claude Code/Anthropic SDK 的团队来说,改 base_url 的成本很低。

反向视角(至少三条):

  1. 官方增量有限:相对 M3 只多「可调思考深度」这一项,上下文与三项主特性相同 ⇒ 「M3.1」不是换代;
  2. 放量范围受限:只能用 Token Plan 与 MiniMax Code,没有普通按量 API ⇒ 自建流水线、CI、批量评测都暂时接不上,要评估只能先进 MiniMax Code;
  3. 思考无法关闭:对短问题、简单分类、高频调用这类场景,默认 max 档的延迟与成本并不友好;
  4. 无基准、无定价、无模型卡:本文检索范围内未见任何第三方评测,官方也未发布该模型的 benchmark 与价格。

:white_check_mark: 已知 vs 待验证

已证实(官方文档一手):

  • 可用范围:only through Token Plan and MiniMax Code for now;
  • 模型表:M3.1-Flash-Preview 与 M3 均为 1,000,000 上下文;M3.1 的特性栏多出 Tunable thinking depth;
  • effort 档位(low/medium/high/xhigh/max)、省略时默认 max、字段名随协议不同;
  • 限制原文:思考无法关闭,thinking:{"type":"disabled"} 或 effort:"none" 返回 400,报错为「model “MiniMax-M3.1-Flash-Preview” requires adaptive thinking」;
  • 接入端点(Anthropic 兼容 https://api.minimax.io/anthropic、OpenAI 兼容 https://api.minimax.io/v1);
  • M2.1 的 230B 总参/10B 激活(官方文档 Legacy 表)。

第三方观察:

  • IT 之家/凤凰科技:「9 月 27 日上线 MiniMax Code」、面向日常开发、主打速度与稳定性(我未直取原文)。

待验证 / 未取到:

  • 官方模型卡/技术报告——未见;
  • 任何 benchmark 分数——官方未为 M3.1-Flash-Preview 发布;
  • 单价与计费口径——官方文档未列;
  • 与 M3 除「可调思考深度」外的其它差异——官方文档未说明;
  • 签到双倍积分活动——未在官方页面取到。

:compass: 给读者的建议

  • 已经在用 Claude Code/Anthropic SDK 的:注意可用范围——它现在只经 Token Plan 订阅与 MiniMax Code 提供,不是普通按量 API;先把额度类型确认清楚,再动手改 base_url(Anthropic 兼容路径是官方推荐的默认路径)。
  • 要控成本的:显式设置 effort。默认是 max,而思考又关不掉 ⇒ 短任务、简单分类、高频调用务必降到 low/medium 再压测一遍延迟与 token。
  • 做选型的:不要把它当成 M3 的升级旗舰——官方口径下多出来的只有「可调思考深度」;也不要把 M3 的 benchmark 图表拿来给它背书(官方没给它发过分数)。
  • 做迁移评估的:无普通 API 这一条会卡住 CI 与批量评测 ⇒ 先把「能不能在订阅通道里跑得起你的评测」作为前置问题。

:link: 来源

官方来源

独立来源

本站相关(背景)

  • topic 152(千问 Qwen3.8-Omni-Flash)、topic 153(智谱 GLM-5.3-FlashX)、topic 162(阶跃 Step 5 Preview)

说明:本条可用范围、模型表、effort 档位、思考无法关闭的限制、接入端点均取自 MiniMax 官方文档(一手);「9 月 27 日上线」与「主打速度与稳定性」为媒体表述(官方文档页未标日期);官方未发布该模型的 benchmark 与定价,本文未引用任何媒体转述价格;M3 产品页的基准图表属 M3,不可作为 M3.1-Flash-Preview 的成绩。配图为官方文档页截图(模型表已裁去页面底部 Cookie 横幅),图注已标来源。