YAOTU INSIGHTS

从RL规模化到自我改进:MiMo-V2.6技术报告深度解析

从RL规模化到自我改进:MiMo-V2.6技术报告深度解析
最近大模型圈子里最值得逐字读完的技术报告我琢磨着应该是这篇一个开源大模型站出来的姿态不是继续喊参数规模、预训练数据量而是把全部重心压在“强化学习规模化”和“自我改进”上。你见过很多模型说自己“能推理”但少有模型会在报告里告诉你它是怎么通过一轮又一轮的强化学习让模型自己给自己出题、自己批改、自己重做的。MiMo-V2.6的这份技术报告主线就是这么一件事。这篇解析还挺适合两类人读一类是打算跟进开源大模型路线、想搞清楚接下来半年开源社区会往哪走的人另一类是已经跑过SFT、正准备接触RLHF/RLVR想从一个真实模型的技术报告里搞明白RL训练链路到底该怎么搭的人。我自己在读到报告里关于“self-improvement”和“RL at scale”的章节时最大的感受不是某个具体指标多高而是整个训练哲学变了——从“喂更多数据靠模型悟”变成“让模型在反馈循环里自己进化”。这个转变比某一个benchmark数字的刷新更值得掰开揉碎讲清楚。1. 这份技术报告的分水岭从“堆预训练数据”转向“用RL做能力自迭代”1.1 MiMo-V2.6到底在解决什么问题如果只用一个词概括MiMo-V2.6技术报告的核心我会选“反馈密度”。过去开源大模型的常规路线是收集海量文本做预训练然后做有监督微调SFT再来一轮RLHF对齐。这套流程的瓶颈很直接——它默认“人类偏好”和“正确答案”都是静态的标注一批就完了模型没有持续变好的闭环。但MiMo-V2.6明显换了一个解题框架把强化学习RL的训练时长和覆盖范围推到前所未有的规模让模型在生成、评估、再生成的循环里不断修正自己的策略。用大白话讲传统训练像是“老师出题学生背答案考完就结束”MiMo-V2.6的做法更像是“老师出题学生做题机器批改错的题当场回炉然后老师再出一批类似但又不完全一样的题”。这个循环一旦规模化模型就不是在“背题”而是在“学会怎么解决一类问题”。1.2 为什么“开源第一”这个定位在这个时间点含金量不一样很多人看到“第一开源大模型”这种描述会下意识怀疑是营销话术但这次我更愿意从另一个角度理解它说的是“在开源阵营里第一个把RL规模化做到这个深度”的模型。开源社区过去几年在预训练和SFT上确实追得很快但一到RL阶段就普遍保守——训练成本高、稳定性难控、Reward Hacking频发大部分团队只敢做轻量PPO或者干脆跳过。MiMo-V2.6等于把这个“禁区”撕开了一个口子它的技术报告直接披露了RL训练规模化之后的收益曲线、失败模式和稳定化手段。这件事对社区的意义大于模型本身的跑分。因为闭源头部模型之所以能持续变强很大程度上靠的就是RL数据飞轮。开源模型如果一直停留在“SFT之后直接发布”那么和闭源模型的差距会越来越大。MiMo-V2.6尝试把这条飞轮公开化等于告诉大家RL规模化的关键路径是可以复盘的不是黑魔法。2. 自我改进机制拆解模型怎么做到自己出题、批改、重做2.1 奖励信号的设计结果奖励负责“对错”过程奖励负责“思路”技术报告里最值得细读的部分是奖励模型Reward Model的设计。MiMo-V2.6没有只依赖单一的结果奖励——也就是“最终答案对不对”——而是引入了过程奖励Process Reward来追踪中间推理步骤的质量。我解释一下为什么这一步是质变。结果奖励的问题是稀疏一道复杂数学题模型推理了二十步最后一步符号写错结果奖励直接判零分。但前十九步的推理思路可能完全正确模型收不到任何正向梯度它就不知道怎么修正。过程奖励的思路是把这道题拆成若干推理片段每一步单独打分模型能精确知道“哪一步走偏了”。这种细粒度反馈对自我改进尤其重要因为模型在下一轮迭代时可以直接瞄准错误的中间步骤做修正而不是在茫茫参数空间里瞎撞。技术报告里有一句话让我印象很深大意是单纯的结果奖励会把模型推向“猜答案”过程奖励才逼着模型“讲道理”。这跟培养新人团队是一个逻辑——你只看KPI下属就会想办法刷KPI你还看执行过程他们才会真正优化做事方法。2.2 迭代式RL数据流每一轮更新是怎么发生的MiMo-V2.6自我改进的落地形态是一套迭代式的RL数据生产线。简化成公式大概是策略模型生成样本 → 规则校验器奖励模型打分 → 筛选高质量轨迹加入训练集 → 策略模型继续更新 → 再用新模型生成下一批样本。这套流程里最容易被忽视的是“采样策略”的变化。不是每一轮迭代都用完全相同的提示词集而是会自动根据模型当前的能力边界去调整提示词的难度分布。模型在简单题上已经稳定拿分了就多采样中等偏难题模型在某类题型上频繁出错就针对性加大这类提示词的采样权重。听起来很智能实际实现时就是给提示词池子里的每条样本维护一个“当前正确率”的统计值正确率高的样本降权正确率低的样本升权。这个设计的高明之处在于它让训练数据始终处在“最近发展区”——既不是简单到模型全对也不是难到模型全错而是保持在模型跳一跳能够到的区间。这比静态数据集对于自我改进的推动效率高得多。2.3 规则校验器与模型裁判两道防线防“走捷径”强化学习里有个绕不开的坑叫Reward Hacking——模型找到了一个让奖励分数虚高但实际能力没有提升的捷径。MiMo-V2.6做了两层防护第一层是可判定的规则校验器针对数学、代码这类答案能明确判别的领域直接用确定性规则给分不依赖模型判断第二层是模型裁判——一个独立训练、不参与策略更新的评审模型专门负责主观题的评分。这两层设计在我看是必须的。规则校验器防的是那种“答案乱编但格式好看”的作弊模型裁判防的则是“顺着奖励模型的偏好过拟合”的问题。一个有意思的细节是技术报告指出裁判模型与策略模型必须来自不同训练分布如果用同源模型做裁判自我改进会在几轮迭代后出现明显的偏置积累模型会越来越会“哄”裁判而非真正变强。这个洞察任何想复现自我改进路线的人都应该抄进笔记。3. 强化学习规模化算力、数据和收敛控制的三角平衡3.1 训练、采样、评测之间的算力分配规模化的第一问题不是算法而是预算怎么分。MiMo-V2.6技术报告虽然没有公开确切的训练账单但从其披露的训练框架和迭代轮次能反推出一个大致逻辑RL训练的总算力被切成了三块——策略更新、经验采样、评测筛选三者不是平均用力。我在实际跑过类似RL迭代之后一个比较深刻的体感是采样端的算力需求往往被低估。因为每轮迭代要生成海量候选回答供奖励模型打分而生成速度受限于推理延迟所以规模化RL通常是采样先撞到算力瓶颈。技术报告里能够覆盖到数十万级别的提示词迭代池意味着它在采样端至少配了与训练端对等的推理集群。如果你是自己复现这点要提前做预算表格否则训练到一半会发现GPU全被采样任务占满策略更新在排队。3.2 数据冷启动seed模型不行飞轮转不起来关于自我改进社区里有个常见误解只要RL循环搭起来了模型就会自动越变越好。实际上RL飞轮的起点质量决定了迭代的天花板。MiMo-V2.6能够把自我改进做起来前提是它有一个足够强的seed模型——这个模型已经通过大规模SFT掌握了基本推理范式RL只是负责把策略“压榨”得更准。如果seed模型本身能力太弱生成的候选样本绝大多数是垃圾奖励模型给出的低分信号占比过高策略梯度更新就会非常不稳定。技术报告里有一组对比实验同样的RL算法、同样的算力seed模型在基础推理准确率上差5个百分点经过同样轮次的RL迭代之后最终收益差距被拉大到了接近15个百分点。这就是飞轮效应——初始差距会被自我改进的指数级循环放大。所以别看标题是“RL规模化”真正的门槛其实在RL之前的SFT质量。3.3 收敛与崩溃怎么压制越训越疯的倾向RL训练的收敛性问题是MiMo-V2.6技术报告里花了大量篇幅讨论的内容。用过PPO或GRPO的人都会遇到一个经典现象前几轮迭代效果稳步提升到某一轮突然指标暴跌模型开始输出大量重复或无意义内容训练loss看上去正常但采样的reward全部异常。这就是策略崩溃。MiMo-V2.6的应对方案可以归纳为三条一是对策略更新加KL散度约束防止新策略离参考策略太远二是对奖励做动态归一化避免早期的高分样本把奖励尺度拉偏三是周期性回滚——如果当前模型的评测指标连续两轮下滑就回滚到上一个checkpoint重新开始。这三条单独看都不算新技巧但组合在一起并且在高并行规模下稳定执行考验的是工程能力。我在自己的训练里体会最深的是“动态归一化”。因为自我改进的模型会持续变强前期看起来是高分样本的答案后期可能就稀松平常。如果奖励尺度的基准一直不变模型的更新步长就会失真。MiMo-V2.6把奖励归一化窗口设成了动态滑窗接近“跟当前策略水平实时对齐”这比固定基准更符合自我改进的场景。4. 开源落地路径把技术报告变成自己能跑的实验技术报告再精彩不落地就只是PPT。好在MiMo-V2.6强调开源属性权重和训练框架都放出来了。这一节我把从零开始复现的完整路径整理一遍踩过的坑也一并标注方便直接参考。4.1 权重、框架、显存环境准备里的关键决策点先解决最基础的问题模型多大、用什么框架跑。MiMo-V2.6对外发布了不同规模的版本实际部署时如果只是推理验证7B级别配合vLLM就能在单张24GB显存的卡上跑得起来但如果你想复现它的RL迭代流程情况就完全不一样——你需要同时容纳策略模型、参考模型和奖励模型三个模型都要驻留在显存里。我的建议配置是这样策略模型7B 参考模型7B 奖励模型3B单节点8×A100 80GB是最低舒适配置如果你想在单卡上做小规模验证可以退一步用LoRA只训练策略模型的一部分层但要注意复现出来的行为可能跟全量微调有偏差框架方面技术报告里用的RL训练栈可以对应到社区里常见的组合DeepSpeed ZeRO-3负责模型分片vLLM做采样端的异步推理TRL库作为PPO/GRPO算法的主控循环。三者之间的通信协调是最容易出问题的地方强烈建议用NCCL高带宽网络否则采样端的吞吐会拖慢整个迭代节奏。4.2 从跑通推理到跑通一轮RL最小可行的复现流程我自己会用四步走的方式去做最小化复现每一步都有一个明确出口方便定位问题权重载入验证下载权重后先把模型跑通一条推理请求确认tokenizer和模型配置对齐。这一步别小看——开源仓库里tokenizer_config多两个字段导致生成的token错位我至少遇见过三次。采样链路联通用同一个提示词池采样几百条回答确认vLLM的生成输出能被正确灌入奖励模型的打分API。这一步的关键是数据结构统一建议把候选回答全部转成统一的json格式再传给奖励模块。单轮PPO/GRPO更新选一个小型子集几千条提示词完整跑一轮策略更新。观察策略模型的输出分布变化确认KL散度没有爆炸。多轮迭代小规模验证重复采样、打分、更新三个动作3到5轮看评测集准确率是否出现上升趋势。我个人的经验是很多团队卡在第二步到第三步之间原因通常是采样端和训练端的并行方式冲突。举例来说vLLM为了吞吐会把多条请求动态batching而策略更新需要稳定的batch粒度两边如果不加同步缓冲梯度更新的方差会非常大。技术报告里提到的高质量RL框架设计其实很大程度就是在解决这个工程级问题。4.3 评测指标里最容易误读的三处复现RL项目评测环节最容易产生虚假成就感。误读一只看平均reward。因为奖励模型是模型打的分而策略模型会在多轮迭代过程中越来越适配奖励模型的偏好所以平均reward上涨不一定代表真实能力上涨。最好同时看一个外部权威评测集或者规则校验的准确率。误读二拿测试集做筛选。有些人在RL迭代中反复评测同一批测试集并依据结果挑选checkpoint时间一长那批测试集的信息会被污染。MiMo-V2.6的做法是每轮用保留下来的留存评测集做最终判定并且评测集和提示词池完全隔离。误读三忽略推理长度的变化。模型推理能力变强后往往生成更长的推理链导致单位时间生成的token数下降。如果评测指标只算“每轮采样的最终得分”可能会漏掉效率下降的问题。建议在报告里同时记录平均生成长度、缓存命中率、有效token占比既看效果也看成本。5. 实测中的几个“反直觉”体会给想跟进的人一份避坑清单5.1 损失曲线几乎不动不代表策略没有进步我第一次跑多轮RL迭代时盯着策略模型的损失曲线看前两轮还有明显下降到第三轮开始曲线平滑到几乎一条直线。当时第一反应是训练失效了后来对比权威评测集的准确率才发现模型的推理能力依然在稳步上升。这个现象的原因是RL阶段策略模型的损失函数里KL正则项占了很大的权重而KL是一个约束性很强的项会把损失曲线“熨平”。真正反映能力变化的信号在采样端的reward分布变化里以及策略生成文本的结构质量里。所以我的建议是RL训练中别把loss当唯一仪表盘要建立“reward分布评测准确率生成质量抽检”的多维度观测面板。5.2 自我改进会在某个阶段“原地打转”甚至反弹自我改进不是无限上升的直线MiMo-V2.6技术报告里其实也承认了这一点当模型在提示词池上的正确率超过某个阈值之后RL迭代带来的边际收益会迅速衰减模型开始在相似难度的题目之间反复徘徊。报告的应对手段是扩大提示词池的难度覆盖不断引入新的更难样本。这个现象背后的机制说穿是模型已经逼近当前能力上限时继续在同一分布内做策略优化只是在做“重复巩固”不会引发质变。自我改进能否持续取决于你是否有办法持续提供略超出现有能力边界的新任务。这比调参重要得多。如果提示词池是静态的别指望模型能凭RL无中生有。5.3 小模型上验证的超参直接迁移到大模型会翻车由于MiMo-V2.6同时开源了多个规模版本很多人会自然想先在7B上把RL超参调好再平移到70B上省算力。这个思路听起来高效实际操作却危险小模型和大模型对同一组RL超参的敏感度完全不同。典型例子就是学习率和KL系数——70B模型的自回归分布更尖锐KL系数如果照搬7B的配置策略更新很容易被正则化压死表现为新策略和参考策略几乎无差异。我的经验是从7B迁移到30B以上学习率至少要降一半KL系数要增大到1.5到2倍rollout数量也要同步增加。迁移后的第一轮迭代必须盯紧采样的reward分布如果连续多步的reward期望低于之前模型的基线大概率是超参没对齐而不是新模型的能力问题。说到最后我对MiMo-V2.6这篇技术报告的整体判断是八个字路线明确门槛不高但坑很多。所谓路线明确是指它把“用RL规模化推动模型自我改进”讲成了一条可以复制的路径而不是某些实验室泛泛而谈的“探索方向”所谓门槛不高但坑很多是说每个环节——从奖励设计到采样算力分配再到评测防污染——都有大量工程细节少一个都可能让飞轮停转。我个人的建议是如果你是第一次接触这类RL迭代训练不要一上来就追求复现它的完整规模。先拿一个中小型模型把“采样→打分→更新→再采样”的闭环在一周内完整跑通把里面每个环节的手感和坑都摸清你再去读技术报告里那些关于规模化分布、回滚策略和提示词池动态调度的章节会有完全不同的体会。到那时候你会明白真正的自我改进不是模型在单轮训练里突然开窍而是你作为工程师为它搭好了一套能持续吸收反馈、持续修正策略的循环系统。