商派资讯新闻

ShopeX News & Insights

小米最新大模型登顶全球第一!罗福莉每天花掉雷军 480 万

小派2026年9月23日

小米 MiMo-V2.6 登顶开源第一,以及它主动公开的那台“电表”。当分数不再是唯一的胜负手,智能的单位成本成为新的战场。

事件 · 2026 年 9 月 22 日,小米发布并开源 MiMo-V2.6 系列
核心指标 · AA 综合智能指数 46 分(开源第一)

  • 46 分 AA 综合智能指数
  • 347 万美元 RL 后训练总成本
  • 56.5% 算力花在“生产与评判经验”上
  • $0.13 单个评测任务成本(Kimi K3 为 $2.00)

📌 本文看点

  • 01 347 万美元买到了什么
  • 02 价格战打的是锚点下移
  • 03 那台电表的另一面

01 一台本不该公开的表

9 月 17 日凌晨,小米 MiMo 大模型团队负责人罗福莉把一段文字和一个链接挂上了社交平台。

文字很短:沉默近半年,我们在研究一个问题——强化学习到底能走多远

链接指向一个实时训练看板。点进去,是 MiMo-V2.6-Pro 和 Flash 两个版本正在跑的强化学习过程:跑到第几步、消耗了多少 token、任务通过率怎么变、累计花费多少美元——全部实时刷新。甚至连训练中哪台机器的显卡掉线、哪个环节中途重启过,都没有藏

小米 MiMo-V2.6 实时训练看板

在主流大模型实验室里,这些数字通常属于“永不公开”的清单

有开发者盯着看了半分钟,费用跳涨 287 美元。换算下来,每秒约 8.5 美元,两个模型合计每小时约 3.1 万美元,折合人民币二十余万元。

“每小时烧掉雷军 20 万”随后成了传播最广的一句话。但这句吐槽恰好错过了重点——真正刺眼的不是花了多少,而是小米选择把这笔账摆在台面上,让人围观。

五天后的 9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列。训练收尾,总账也来了:Pro 版 262 万美元,Flash 版 85 万美元,合计 347 万美元;不到六天,各跑 30 步,累计约 75 万条轨迹

如果只盯着分数,这是一次登顶。但把这几件事放在一起看,它更像一次定价权的宣示智能这一度电该卖多少钱,小米递出了自己的报价单。

⏱ 这轮训练的时间线

  • 09 / 15 强化学习训练启动。Pro 与 Flash 两条 run 同时开跑,单步 1568 个 prompt × 16 条 rollout。
  • 09 / 17 实时训练看板对外公开。此时累计成本约 135 万美元,两模型合计约每小时 3.1 万美元。
  • 09 / 22 发布并开源,公布总账。不到 6 天、各 30 步、约 75 万条轨迹,合计 347 万美元。

02 先纠一个偏:是“开源第一”,不是“全球第一”

先说结论:小米这次拿下的,是开源权重模型的第一,不是全球第一。这两个第一之间,隔着 7 分

在第三方评测机构 Artificial Analysis 的综合智能指数(Intelligence Index v4.3.2)上,MiMo-V2.6-Pro 拿到 46 分。榜单顶端是 Claude Fable 5.1 和 GPT-6 Astra,各 53 分;再往下是 Claude Opus 5 的 51 分。46 分让 MiMo 站在了“所有可下载模型中分数最高”的位置,前方四个身位全部是闭源

模型 智能指数 类型
Claude Fable 5.1 53 闭源
GPT-6 Astra 53 闭源
Claude Opus 5 51 闭源
MiMo-V2.6-Pro 46 开源
GLM-5.3 45 开源
Kimi K3 44 开源

同样值得注意的是:xAI 的 Grok 4.7 在同一天发布,也是 46 分上下。所以严格说,这是一次并列抵达,而不是断层领先。小米自己的官方通稿也承认了与 53 分梯队的差距——这一点值得肯定,比大多数厂商的自宣诚实。

但 46 分这个数字有一层特殊价值,是它后面所有数字都没有的:它是唯一一个由第三方独立测出来的数

这一句话,同时是小米这次最硬的地方,也划出了它可信度的边界。因为除它之外——DeepSWE、Terminal-Bench、AutomationBench、CyberGym、MiMo Visual Coding,全部是小米用自己的评测框架、跑自己的模型、对比别家的模型得出的结果。截至发稿,没有任何一家外部机构复现过这条曲线

行业里有句老话:看厂商跑分像看相亲照,滤镜厚度全凭良心。这次不同的是,小米把原图也一并交出来了——只是原图需要你自己去洗

03 347 万美元买到的,其实不是“更高的分数”

这是我认为整件事里最被忽略、也最有信息量的一块。

小米在技术报告里把 Pro 版强化学习的钱花在哪,摊开讲了。结果是这样的:

  • 43.8% 生成轨迹 rollout
  • 43.5% 更新权重 training
  • 12.7% 评审打分 grader
  • 生成轨迹 rollout:让模型去真实环境里干活,产出可供学习的经验。
  • 更新权重 training:真正改变模型参数——这是传统意义上“训练”的部分。
  • 评审打分 grader:给长程任务提供细粒度奖励信号,判断活干得好不好。

也就是说,超过一半的算力,没有用在“让模型变聪明”上,而是用在“让模型去环境里干活,再把干过的活评价一遍”。

这个结构的变化,比 46 分重要得多。它意味着后训练时代的成本重心,已经从“模型”迁移到了“环境和评分器”。过去衡量一家公司的 AI 实力,看有多少张卡;往后要看能造出多少个可验证的任务环境,以及能不能稳定地给这些任务打分。

这也解释了小米为什么开源得如此“反常”:不只是权重(MIT 协议)。还有完整技术报告、七千余个带校验器的 RL 任务环境(覆盖软件工程、漏洞复现、知识型工作、网页设计开发四大类)、端到端 RL 训练框架(基于 verl、uni-agent、mini-swe-agent)、可组合的轻量 Agent 框架,以及一个在 21 项评测上全面超过原始基线的小模型 MiMo-V2.6-Distill-Qwen-9B。

「权重告诉你这轮训练产出了什么;环境告诉你这轮实验怎么做一遍。后者才是能长期沉淀的资产。」

但边界也要说清楚:开放的是任务环境、奖励逻辑和训练代码,评分器(grader)本身的权重并没有一起发布。配方给了,主考官没给全。这是国内厂商第一次把 Agentic RL 的核心生产要素打包开放,但它还不是一次完整的奖励模型释放。

04 价格战打的不是“便宜”,是“锚点在下移”

小米这次最直观的冲击力来自价格:Pro 版每百万 token 输入 3 元、输出 6 元;Flash 版输入 1 元、输出 2 元。较上一代一分未涨,而智能水平大幅提升。官方给出的对标口径是:同等智能水平下,价格仅为海外模型的 1/20 至 1/60

这句对标成立,但它有个前提容易被忽略:单价便宜,不等于实际开销便宜。Agent 类任务是多轮调用,一个任务动辄几十次工具往返,token 消耗按轮次放大。纸面单价和真实账单之间,隔着一整套调用架构。

更该注意的是一个反例。

有独立分析者在拆解小米的评测表时发现:DeepSeek V4.1 Flash 在 DeepSWE 上的得分是 74.2,高于 MiMo-V2.6-Pro 的 71.9;在 AutomationBench、Agents’ Last Exam、Terminal-Bench 2.1 上也同样领先。而它的成本是每个评测任务 0.27 美元。

这意味着一件事:“斩杀线”并没有被某一家单方面重划,它在国产模型之间来回拉锯。就在几个月前,开发者还在把 DeepSeek V4 Flash 当作性价比基准;今天小米把这条线又往下推了一格,但推线的动作,是多家在轮流做的

所以真正发生的变化不是“谁第一”,而是这个:

「同等级智能的价格锚点,正在被连续、快速地下拉。46 分这一档的单位任务成本,从 Kimi K3 的 2 美元,被压到 MiMo-V2.6-Pro 的 0.13 美元。」

榜单上的名次每周都在动,但价格中枢的单向下移,是一条更确定的趋势线。这才是“集体向上”里真正有分量的部分——不是谁站得更高,而是高处越来越便宜。

05 那台电表的另一面

公开训练账本,是一次漂亮的公关,也是一次有风险的自我暴露。作为观察者,至少有三处裂缝需要指出。

第一,计数器无法被外部审计。看板是自报的,外部看不到 GPU 集群的原始账单。而且被丢弃的算力没有计入总账——公开信息显示,Pro 在约第 17 步发生过重启,Flash 从约第 15 步重启。所谓“30 步、347 万美元”,是幸存下来的尾巴,前面被烧掉的算力没有出现在任何一行明细里。真实成本高于账面成本,这是技术上的必然。

第二,公开的数字之间对不上。实时看板上 Pro 版 DeepSWE 是 72.57,正式模型卡上变成了 71.9——数字下降了;Flash 从 65.68 升到 67.9,上升了。同一轮训练、两次评测,差异量级几乎等于两个模型之间的差距。另外,模型卡说投机解码的 drafter 是 5 层、单次预测 7 个 token,但同仓库的 config 文件写的是 3 层;权重文件报告的参数量也和模型卡口径对不上,官方未做解释。

第三,披露存在明确的结构性缺口。这次没有 system card,没有具名的红队合作方,没有训练数据截止时间。小米自己的产品页在直接抓取时返回不了任何规格与安全信息——对做合规尽调的人来说,这个一手来源是不合格的

我很欣赏这次公开。它把“过程透明”推到了国内厂商从未有过的位置,Hacker News 上最高赞的评论说的也是同一件事:这是我见过最好的教学工具,它甚至写了那些没做好的部分。

但需要区分两件事:过程透明,和结果可验证,不是一回事。看板能让你看见它怎么跑,不能让你确认它跑出了什么。真正能结算的,是第三方用不受小米控制的框架复跑一遍最终权重——而这个,至今没有出现

06 差距在收窄,但收窄的形状是不平的

这一代最值得记录的进步,其实不是总分。

Artificial Analysis 的一条长期观察:开源与闭源头部之间的追赶时间在系统性缩短——纯规模扩张时代用了约 18 个月追 36 分,推理时代用 8.5 个月追 12 分,到了 Agent 时代,只需要约 5 个月追 5 分。每一代,开源追平当期领先闭源模型所需的时间大约减半

而 MiMo-V2.6 让“追平”第一次带上了局部反超的意味。在它自己的评测表里,有三项已经超过 Claude Opus 5;相对上一代 MiMo-V2.5-Pro 在 DeepSWE 上仅 19.0 的成绩,这是断崖式的跃升,并且跨域普遍成立。

评测项 MiMo-V2.6-Pro Claude Opus 5
AutomationBench v1.0.6 53.1 50.3
Terminal-Bench 2.1 89.9 89.1
MiMo Visual Coding 72.3 70.0
Terminal-Bench 4.0 34.9 49.0
ExploitBench 47.9 70.0
ExploitGym 17.8 22.1

Terminal-Bench 4.0、ExploitBench、ExploitGym——这三项的共同点是“面向未知的探索”:在陌生环境里定位真实漏洞、构造可用的攻击链、处理科学导向的复杂推理。

把这个分野说白一点:“在已知环境里把活干完”,国产已经追上甚至局部反超;“在未知环境里发现新问题”,仍然是闭源的主场。

这与一份同期提交给美国国会的证词相互印证:中国开源模型在 agentic coding 这类定向商业负载上表现最强,已经摸到前沿;但在物理、生物等开放式科学评测上,落后幅度更大

所以“集体向上”是真的,但“向上”的分布极不均匀。而这个分布,比总分更值得企业采购者关注

07 真正的瓶颈,换了一个地方

回到小米给这次发布定的调子:这是探索 RSI(递归自我改进)的关键一步——以可验证的复杂任务为基础,把强化学习算力规模化,让模型在持续的探索与反馈中自己学会。

技术报告里那套东西是有分量的:让 Agent 自己去代码库里逆向生成任务(自己出题)、用组内奖励合成与优势重分配做多维度打分(自己当考官)、放一个专职 Hack Agent 疯狂攻击训练环境以堵住奖励作弊(自己找漏洞)——作弊轨迹占比全程压在 2% 以下。工程细节也足够扎实:不冻结 MoE 路由会引发专家负载崩塌,负载变异系数从 0.78 飙到 2.0、峰值负载从 6 倍涨到 16 倍,冻结后才稳定下来。

但小米自己在报告里也承认了边界:模型不能自主生成下一代模型,闭环自我迭代并未实现。RSI 是方向,不是现状。

那么当下真正的卡点是什么?我认为是可验证任务的供给

七千余个任务环境听起来很多,但它们是人工构造的标准化任务,与互联网原生的真实复杂任务之间仍有明显落差。这决定了三个必须回答的问题:开放出去的这套环境,社区能多快再生产出新任务?在同一个任务集上持续迭代,模型会不会过拟合到分布外的真实任务上跳水?在其他实验室用不同配置复现时,这条能力增益曲线还在不在?

大规模 RL 的可复现性,一直是这个行业的痛点。递归自我改进的叙事是否成立,最终由后两个问题裁决。

不要按榜单选型

小米这次做对了两件事:第一,把第三方能测的那一个数字(46 分)放在最前面;第二,把第三方测不了的那些过程,尽可能摊开。这两件事合起来,构成了一个相对诚实的发布——不完美,但比“跑分屠榜”要可信得多。

至于 MiMo-V2.6 本身值不值得用,我给三条判断:

一、看独立数字,不看厂商表格。46 分可以信,71.9、53.1、89.9 这些要打问号,直到有人复跑

二、按“每个成功任务的总成本”算账,不要按“每百万 token 的单价”算。Agent 场景下,重试次数、多轮调用、缓存命中率对总成本的影响,远大于单价差异。上线之前,用自己的真实业务负载跑两周。

三、Flash 可能是大多数团队的起点,而不是 Pro。它在多数指标上与旗舰只差几分,内存占用约为三分之一,CyberGym 上甚至反超。Pro 的优势集中在 Terminal-Bench 4.0 和漏洞利用类任务——那是另一类需求。

最后,关于大势。经过 MiMo-V2.6 这一轮,“开源第一”这个位置的含金量,已经不再是“能跑”或者“够便宜”,而是“和闭源头部只差 7 分,还便宜一个数量级”。这个变化不是某一家公司带来的,是 DeepSeek、Qwen、GLM、Kimi、MiMo 轮流推出来的。

而这一轮真正被改写的,不是榜首的名字。

「是把“智能”这件事,第一次放上了可以按度计价的计价器。而这台计价器的读数,正在以每一代减半的速度往下走。」

数据来源:Artificial Analysis Intelligence Index v4.3.2、小米 MiMo-V2.6 技术报告与官方发布材料、Nathan Lambert 国会证词(2026-09-21)等公开信息。其中 46 分为第三方独立评测;其余厂商自测分数标注为待独立复现。

免费咨询热线400-821-3016
在线咨询