https://x.com/i/article/2108826378812768256
小米 MiMo-V2.6 技术报告:260 万美元 RL 算力与三维扩展,将万亿 MoE 模型推入前沿梯队
MiMo-V2.6:以扩展强化学习逼近自我改进
论文:MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement,小米 LLM-Core 团队,2026 年 10 月发布。
核心论点
这篇报告的中心命题可以浓缩为一句话:当下提升基础模型智能最有效的路径,不是继续堆预训练数据,而是系统性地扩展 RL 算力;而且这种扩展必须同时在三个维度进行:更大的训练批次、更多样的环境、更贵的评分器(grader)。三者缺一,RL 就会不稳定或被 reward hacking 带偏。
模型本身有两个规格:MiMo-V2.6-Pro(1.02T 参数 MoE,激活 42B)和 MiMo-V2.6-Flash(310B,激活 15B)。RL 后训练分别花费 260 万美元和 90 万美元,这个成本披露本身就是论文的一个亮点,它把“前沿智能”的价码摆在了桌面上。
基座:为 RL 而生的架构与中期训练
架构延续 hybrid-SWA 设计:局部滑窗注意力(窗口 128)与全局注意力按约 4:1 交错,配合稀疏 MoE、MTP 模块、681M 参数的自研 ViT 和双级音频编码器。这些设计的目标是在超长上下文(1M token)下压低注意力的计算开销,这是后续 RL 需要的工程前提。
中期训练(Mid-training) 值得注意的两个决策:
1.优化器切换:从 AdamW 切到 Muown(Muon 变体,增加行范数控制)。理由很实际:RL 用超大 batch(每步 25K 条轨迹),AdamW 的逐元素自适应在大 batch 区间优化效率下降,而 Muon 的矩阵正交化更新在此区间仍保持数据效率。论文特别提到,此前有工作报告 Adam→Muon 切换会导致性能退化,但他们全程无 loss spike。
2.MXFP4 量化感知训练在中期训练就引入,让模型提前适应低精度计算,为 RL 期间的推理侧量化铺路。
这一节传递的信息是:RL 能不能 scale,一半在中期训练就决定了。模型要先在优化器、精度、上下文长度上“准备好承受大 batch”。
RL 三维扩展(论文核心)
3.1 训练算力:单步 25K 轨迹、27~37 亿 token
每个训练步消费 1,568 个 prompt × 16 rollouts = 25K 条轨迹、约 110K~150K token/条,单步 2.7~3.7B 训练 token,上下文最长 1M。采用 GRPO + 异步 partial rollout(staleness=4)。成本构成很均衡:rollout 43.8%、训练 43.5%、评分 12.7%。
技术细节里有几处值得注意:
•四段解耦的 clip 边界:正/负 advantage 的上下 clip 边界分开设置(初始 [0.2, 5.0]),并按策略熵在线调节,熵过低时放宽正边界、收紧负边界,反之亦然。这是对 DAPO 式 clip 思想的精细化。
•Prompt-mean 聚合(而非 token-mean)抑制回复长度增长。
•动态采样过滤全对/全错组,partial rollout 维持批饱和。
3.2 环境与 Harness:四域 + 多 harness 训练
任务构成:代码 68%、美学设计 13%、通用工具 12%、网络安全 4%、上下文遵循 3%。每个域的环境构建方法都不同,且都把“监督信号的可靠性”放在第一位:
•代码:五条任务合成通路(GitHub PR、内部真实请求、规格驱动、CodeMidas 源码推导、外部数据)。质量把关相当严:规格-测试对齐审查、审计 agent 对比 4 次 rollout 与奖励是否一致(抓假阳/假阴)、8 次重跑筛 flaky 测试。
•通用 agent:多 agent 工作流合成“本地、可复现、可重置”的软件 mock 环境,原子化二元 rubric 评分,用对抗性解法测试防 hack。
•视觉:开放式设计用 pointwise + groupwise 混合评分;高保真复刻用像素相似度等规则指标。
•网络安全:这是全文最漂亮的工程判断之一。他们指出 CyberGym 的 fix-binary 差分测试(崩溃于未打补丁版本但不崩溃于已打补丁版本)有内在缺陷,补丁不完整会错杀正确 PoC,无关变更会翻转判定,任何一种错误都会污染训练梯度。他们的替代方案:从 ground-truth sanitizer 报告中提取漏洞类型 + 崩溃位置两个属性,规则化字符串匹配验证,确定性、可复现、计算成本趋近于零,且任务描述和验证共用同一事实源。
Multi-harness 训练是一个有洞察的设计:直接在生产级 harness(如 Codex)上训练有两个问题,生产 harness 的约束提示词落在奖励信号之外(信用分配失真),且模块紧耦合无法单独变化。他们改用从最小 agent loop 派生的 mini-harness,模块化可重组。实验证明有效:三个 held-out harness(codex、claude code、mini-swe-agent)的平均 Pass@1 从约 50% 升至 66%,训练/未见 harness 间的差距收窄,能力确实跨 harness 迁移,而非记住特定交互机制。
Reward hacking 防御是四层纵深:中期训练中植入反hack反思数据 → 环境准备(清除构建产物、截断 git 历史、容器级网络隔离)→ Hack Agent 迭代渗透测试(反复攻破、修复、再攻破,直到攻不破)→ 训练期离线审计。表 2 列出的五种“解法泄漏”模式(装新版本当答案、拉上游源码、查 issue 历史、探测版本号等)非常真实,值得任何做 agentic RL 的人收藏。最终确认 hack 轨迹占比全程压在 2% 以下。
3.3 Groupwise Agentic Grading:把 grader 也当成可扩展的算力
这是论文方法论上最有新意的部分。核心观察:二元测试奖励无法区分“都通过”的解之间的质量差异,而这部分信息恰恰是引导模型产生高质量、token 高效解的关键。
两条互补路线:
•GRS(离线):离线收集多次 rollout,让 agent 对比分析后为任务定制“解法 rubric + 行为 rubric”,最终奖励 = 测试奖励 × 解法分 × 行为分(乘法保持“不过测试就是零分”的底线)。
•GAR(在线):在线 grader 联合审视同组成功/失败轨迹,沿五个维度(方案适切性、实现精度、最小化改动、无副作用、代码工艺)排序,然后按质量因子 f_i 将正 advantage 从低质量通过解重新分配给高质量通过解(公式 3),数学上保持正 advantage 总量守恒。确认 hack 的轨迹奖励直接归零后重算组统计。
消融证据(图 8)很有说服力:没有在线评分时,轮次和 token 长度失控增长、大量轨迹撞长度上限、pass rate 停滞;开启后 pass rate 持续提升且轮次稳定。更重要的定性发现:无在线评分的策略会学出投机取巧的坏习惯,加投机兼容分支、放宽校验、吞异常、改评测配置,而在线评分训练出的策略产出更小、更精准、更可维护的 patch。这一段本质上是在说:RL 会精确地优化你测量的东西,所以你必须把“代码品味”也变成可测量的。
配套的两个行为正则化(组相对长度惩罚按组内成功解的分位长度扣分、segment 级行为惩罚对格式错误/坏工具调用做 token 级 advantage 整形)都遵循同一设计哲学:优势质量守恒式重分配,避免负压累积导致的熵失控。
实验章节:"You Only RL Once"
章节标题本身就是态度:一轮大规模混合 RL 跑到底,而非多轮 SFT/RL 交替。
Router 冻结是全文最干净的一项科学发现:MoE router 可训练时,Pro 模型在 20 步内出现专家负载崩塌(CV 从 0.78 → 2.0,峰值负载 6× → 16×,冷专家 0.5% → 22%)。关键诊断:把 step-20 检查点的 router 参数单独恢复初始值,负载立即恢复且性能不变,证明崩塌源于 router 漂移而非专家权重退化。冻结 router 后三项指标全程平稳、性能正常增长。
失败分析罕见地诚实:GPU 双位错误、K8s 崩溃、partial rollout 的短轨迹偏置导致 KV 池耗尽、MoE 微批内 30× 不均衡导致的 OOM、packing 阶段的 CPU OOM。这一节对要复现大规模 RL 的人是真正的施工指南。
最终成绩(表 3):相对 MiMo-V2.5-Pro 是碾压式提升(DeepSWE 19.0→71.9,CyberGym 40.0→94.0,Terminal-Bench 2.1 65.2→89.9),与 Claude Opus 5 / GPT-5.6 Sol 基本进入同一梯队,部分基准领先(JobBench、AutomationBench、MiMo Code Bench),部分落后(ProgramBench、ExploitBench、Terminal-Bench 4.0)。
MOPD2 用于 RL 之后的能力拓宽:多前缀多教师在线蒸馏,通过把教师轨迹切成 k 个历史前缀、学生只生成单轮,把 token 级教师监督扩展到难以设计验证器的领域(游戏开发、科研、具身智能)。这是对“RL 只能做可验证任务”这一限制的务实回应。
基础设施(第 6 节)要点
这一章约占论文三分之一,是工程含金量最高的部分,几个关键抽象:
•Agent Loop 执行模型:每条序列自己拥有环境生命周期、按需调用推理引擎,接口纯 token 进出。轨迹组织为 Sample→Sequence→Context→Segment 四级层级,Penalty Module(规则 × 策略)在此层级上做细粒度损失掩蔽与 advantage 整形,把基础设施故障排除在学习信号之外。
•控制面/数据面分离:driver 只调度轻量元数据,重载荷(MoE 路由记录、top-p 候选集、多模态数据)一次写入分布式 KV store、消费端就地打包。这是单步 3B+ token 批次能在不撑爆单机内存的前提下组批的前提。
•Sample Mixer:25 个数据源的 rollout 时长和生成量差异高达 66~90 倍,通过自适应并发预算、缺口校正调度、预测式派发(估计 KV 需求后再准入)、样本重放四种机制维持目标训练分布。
•训练-推理一致性:MXFP4 QDQ 保证权重位相同;R3 重放 rollout 时的专家路由;top-p 候选集录制并在训练时按之重归一化(top-p 0.97 时平均候选集 <5 个 token,开销可忽略)。这些机制解决的是一个容易被忽视的问题,训练引擎和推理引擎的数值差异会翻转离散的专家选择,从而破坏 importance sampling 的正确性。
•推测解码:RL 期间默认用 block-6 DFlash 替代 SFT 的 MTP-3,并用 RL rollout 日志微调 draft 模型,接受长度提升 31.3%,配合 FP8 后单节点吞吐提升约 10.3%。
开源与可复现性
开源四件套:MiMo-V2.6-Distill-Qwen-9B(Qwen3.5-9B 在 774 亿 token MiMo 数据上 SFT 而来)、约 7K 任务的带验证器环境(代码/网络/通用/视觉)、端到端 RL 框架、可组合 mini-harness。验证实验扎实:9B 蒸馏模型在 11 项评测上全部超越 Qwen3.5-9B,再做领域 GRPO 又全部进一步提升;多 harness RL 实验 21 个“数据集×harness”组合无一退化。
一句话总结:MiMo-V2.6 的真正主张不是“我们的模型很强”,而是“规模化的 agentic RL = 大批次 × 多样环境 × 细粒度评分 + 一整套防崩塌工程,每一项都做对,自我改进的飞轮就能转起来;任何一项缺席,算力就会变成对错误信号的精确优化”。
