Skip to content
View original post on X: meng shaoX· Pick79/100AI score79/100

Xiaomi's MiMo-V2.6 report explains scaling RL along batch, environments, and grading

AISummary

Xiaomi's MiMo-V2.6 technical report argues that scaling reinforcement learning, not more pretraining data, is the main lever for frontier capability, along batch size, environment diversity, and grader strength.

The article summarizes the report's methods, including groupwise agentic grading, a frozen-router fix for expert load collapse, and reward hacking defenses.

It reports RL post-training costs of $2.6 million for MiMo-V2.6-Pro and $0.9 million for MiMo-V2.6-Flash.

AIWhy it matters

The piece walks through the report's three-way RL scaling method, batch size, environments, and grading, with concrete failure modes and stabilization fixes useful to agentic RL practitioners.

Post on XView on X
meng shaoVerified on X
@shao__meng

https://x.com/i/article/2108826378812768256

小米 MiMo-V2.6 技术报告:260 万美元 RL 算力与三维扩展,将万亿 MoE 模型推入前沿梯队

MiMo-V2.6:以扩展强化学习逼近自我改进

论文:MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement,小米 LLM-Core 团队,2026 年 10 月发布。

核心论点

这篇报告的中心命题可以浓缩为一句话:当下提升基础模型智能最有效的路径,不是继续堆预训练数据,而是系统性地扩展 RL 算力;而且这种扩展必须同时在三个维度进行:更大的训练批次、更多样的环境、更贵的评分器(grader)。三者缺一,RL 就会不稳定或被 reward hacking 带偏。

模型本身有两个规格:MiMo-V2.6-Pro(1.02T 参数 MoE,激活 42B)和 MiMo-V2.6-Flash(310B,激活 15B)。RL 后训练分别花费 260 万美元和 90 万美元,这个成本披露本身就是论文的一个亮点,它把“前沿智能”的价码摆在了桌面上。

基座:为 RL 而生的架构与中期训练

架构延续 hybrid-SWA 设计:局部滑窗注意力(窗口 128)与全局注意力按约 4:1 交错,配合稀疏 MoE、MTP 模块、681M 参数的自研 ViT 和双级音频编码器。这些设计的目标是在超长上下文(1M token)下压低注意力的计算开销,这是后续 RL 需要的工程前提。

中期训练(Mid-training) 值得注意的两个决策:

1.优化器切换:从 AdamW 切到 Muown(Muon 变体,增加行范数控制)。理由很实际:RL 用超大 batch(每步 25K 条轨迹),AdamW 的逐元素自适应在大 batch 区间优化效率下降,而 Muon 的矩阵正交化更新在此区间仍保持数据效率。论文特别提到,此前有工作报告 Adam→Muon 切换会导致性能退化,但他们全程无 loss spike。

2.MXFP4 量化感知训练在中期训练就引入,让模型提前适应低精度计算,为 RL 期间的推理侧量化铺路。

这一节传递的信息是:RL 能不能 scale,一半在中期训练就决定了。模型要先在优化器、精度、上下文长度上“准备好承受大 batch”。

RL 三维扩展(论文核心)

3.1 训练算力:单步 25K 轨迹、27~37 亿 token

每个训练步消费 1,568 个 prompt × 16 rollouts = 25K 条轨迹、约 110K~150K token/条,单步 2.7~3.7B 训练 token,上下文最长 1M。采用 GRPO + 异步 partial rollout(staleness=4)。成本构成很均衡:rollout 43.8%、训练 43.5%、评分 12.7%。

技术细节里有几处值得注意:

•四段解耦的 clip 边界:正/负 advantage 的上下 clip 边界分开设置(初始 [0.2, 5.0]),并按策略熵在线调节,熵过低时放宽正边界、收紧负边界,反之亦然。这是对 DAPO 式 clip 思想的精细化。

•Prompt-mean 聚合(而非 token-mean)抑制回复长度增长。

•动态采样过滤全对/全错组,partial rollout 维持批饱和。

3.2 环境与 Harness:四域 + 多 harness 训练

任务构成:代码 68%、美学设计 13%、通用工具 12%、网络安全 4%、上下文遵循 3%。每个域的环境构建方法都不同,且都把“监督信号的可靠性”放在第一位:

•代码:五条任务合成通路(GitHub PR、内部真实请求、规格驱动、CodeMidas 源码推导、外部数据)。质量把关相当严:规格-测试对齐审查、审计 agent 对比 4 次 rollout 与奖励是否一致(抓假阳/假阴)、8 次重跑筛 flaky 测试。

•通用 agent:多 agent 工作流合成“本地、可复现、可重置”的软件 mock 环境,原子化二元 rubric 评分,用对抗性解法测试防 hack。

•视觉:开放式设计用 pointwise + groupwise 混合评分;高保真复刻用像素相似度等规则指标。

•网络安全:这是全文最漂亮的工程判断之一。他们指出 CyberGym 的 fix-binary 差分测试(崩溃于未打补丁版本但不崩溃于已打补丁版本)有内在缺陷,补丁不完整会错杀正确 PoC,无关变更会翻转判定,任何一种错误都会污染训练梯度。他们的替代方案:从 ground-truth sanitizer 报告中提取漏洞类型 + 崩溃位置两个属性,规则化字符串匹配验证,确定性、可复现、计算成本趋近于零,且任务描述和验证共用同一事实源。

Multi-harness 训练是一个有洞察的设计:直接在生产级 harness(如 Codex)上训练有两个问题,生产 harness 的约束提示词落在奖励信号之外(信用分配失真),且模块紧耦合无法单独变化。他们改用从最小 agent loop 派生的 mini-harness,模块化可重组。实验证明有效:三个 held-out harness(codex、claude code、mini-swe-agent)的平均 Pass@1 从约 50% 升至 66%,训练/未见 harness 间的差距收窄,能力确实跨 harness 迁移,而非记住特定交互机制。

Reward hacking 防御是四层纵深:中期训练中植入反hack反思数据 → 环境准备(清除构建产物、截断 git 历史、容器级网络隔离)→ Hack Agent 迭代渗透测试(反复攻破、修复、再攻破,直到攻不破)→ 训练期离线审计。表 2 列出的五种“解法泄漏”模式(装新版本当答案、拉上游源码、查 issue 历史、探测版本号等)非常真实,值得任何做 agentic RL 的人收藏。最终确认 hack 轨迹占比全程压在 2% 以下。

3.3 Groupwise Agentic Grading:把 grader 也当成可扩展的算力

这是论文方法论上最有新意的部分。核心观察:二元测试奖励无法区分“都通过”的解之间的质量差异,而这部分信息恰恰是引导模型产生高质量、token 高效解的关键。

两条互补路线:

•GRS(离线):离线收集多次 rollout,让 agent 对比分析后为任务定制“解法 rubric + 行为 rubric”,最终奖励 = 测试奖励 × 解法分 × 行为分(乘法保持“不过测试就是零分”的底线)。

•GAR(在线):在线 grader 联合审视同组成功/失败轨迹,沿五个维度(方案适切性、实现精度、最小化改动、无副作用、代码工艺)排序,然后按质量因子 f_i 将正 advantage 从低质量通过解重新分配给高质量通过解(公式 3),数学上保持正 advantage 总量守恒。确认 hack 的轨迹奖励直接归零后重算组统计。

消融证据(图 8)很有说服力:没有在线评分时,轮次和 token 长度失控增长、大量轨迹撞长度上限、pass rate 停滞;开启后 pass rate 持续提升且轮次稳定。更重要的定性发现:无在线评分的策略会学出投机取巧的坏习惯,加投机兼容分支、放宽校验、吞异常、改评测配置,而在线评分训练出的策略产出更小、更精准、更可维护的 patch。这一段本质上是在说:RL 会精确地优化你测量的东西,所以你必须把“代码品味”也变成可测量的。

配套的两个行为正则化(组相对长度惩罚按组内成功解的分位长度扣分、segment 级行为惩罚对格式错误/坏工具调用做 token 级 advantage 整形)都遵循同一设计哲学:优势质量守恒式重分配,避免负压累积导致的熵失控。

实验章节:"You Only RL Once"

章节标题本身就是态度:一轮大规模混合 RL 跑到底,而非多轮 SFT/RL 交替。

Router 冻结是全文最干净的一项科学发现:MoE router 可训练时,Pro 模型在 20 步内出现专家负载崩塌(CV 从 0.78 → 2.0,峰值负载 6× → 16×,冷专家 0.5% → 22%)。关键诊断:把 step-20 检查点的 router 参数单独恢复初始值,负载立即恢复且性能不变,证明崩塌源于 router 漂移而非专家权重退化。冻结 router 后三项指标全程平稳、性能正常增长。

失败分析罕见地诚实:GPU 双位错误、K8s 崩溃、partial rollout 的短轨迹偏置导致 KV 池耗尽、MoE 微批内 30× 不均衡导致的 OOM、packing 阶段的 CPU OOM。这一节对要复现大规模 RL 的人是真正的施工指南。

最终成绩(表 3):相对 MiMo-V2.5-Pro 是碾压式提升(DeepSWE 19.0→71.9,CyberGym 40.0→94.0,Terminal-Bench 2.1 65.2→89.9),与 Claude Opus 5 / GPT-5.6 Sol 基本进入同一梯队,部分基准领先(JobBench、AutomationBench、MiMo Code Bench),部分落后(ProgramBench、ExploitBench、Terminal-Bench 4.0)。

MOPD2 用于 RL 之后的能力拓宽:多前缀多教师在线蒸馏,通过把教师轨迹切成 k 个历史前缀、学生只生成单轮,把 token 级教师监督扩展到难以设计验证器的领域(游戏开发、科研、具身智能)。这是对“RL 只能做可验证任务”这一限制的务实回应。

基础设施(第 6 节)要点

这一章约占论文三分之一,是工程含金量最高的部分,几个关键抽象:

•Agent Loop 执行模型:每条序列自己拥有环境生命周期、按需调用推理引擎,接口纯 token 进出。轨迹组织为 Sample→Sequence→Context→Segment 四级层级,Penalty Module(规则 × 策略)在此层级上做细粒度损失掩蔽与 advantage 整形,把基础设施故障排除在学习信号之外。

•控制面/数据面分离:driver 只调度轻量元数据,重载荷(MoE 路由记录、top-p 候选集、多模态数据)一次写入分布式 KV store、消费端就地打包。这是单步 3B+ token 批次能在不撑爆单机内存的前提下组批的前提。

•Sample Mixer:25 个数据源的 rollout 时长和生成量差异高达 66~90 倍,通过自适应并发预算、缺口校正调度、预测式派发(估计 KV 需求后再准入)、样本重放四种机制维持目标训练分布。

•训练-推理一致性:MXFP4 QDQ 保证权重位相同;R3 重放 rollout 时的专家路由;top-p 候选集录制并在训练时按之重归一化(top-p 0.97 时平均候选集 <5 个 token,开销可忽略)。这些机制解决的是一个容易被忽视的问题,训练引擎和推理引擎的数值差异会翻转离散的专家选择,从而破坏 importance sampling 的正确性。

•推测解码:RL 期间默认用 block-6 DFlash 替代 SFT 的 MTP-3,并用 RL rollout 日志微调 draft 模型,接受长度提升 31.3%,配合 FP8 后单节点吞吐提升约 10.3%。

开源与可复现性

开源四件套:MiMo-V2.6-Distill-Qwen-9B(Qwen3.5-9B 在 774 亿 token MiMo 数据上 SFT 而来)、约 7K 任务的带验证器环境(代码/网络/通用/视觉)、端到端 RL 框架、可组合 mini-harness。验证实验扎实:9B 蒸馏模型在 11 项评测上全部超越 Qwen3.5-9B,再做领域 GRPO 又全部进一步提升;多 harness RL 实验 21 个“数据集×harness”组合无一退化。

一句话总结:MiMo-V2.6 的真正主张不是“我们的模型很强”,而是“规模化的 agentic RL = 大批次 × 多样环境 × 细粒度评分 + 一整套防崩塌工程,每一项都做对,自我改进的飞轮就能转起来;任何一项缺席,算力就会变成对错误信号的精确优化”。

Source: meng shao · x.comPublished · added here