什么情况?小米新模型的强化学习训练,直接开了现场直播。
点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是 10 美刀,一分钟就是 4000 多元人民币出去了。

当然烧钱的速度可能不是均匀的,从 pro 模型开始训练算起 36 小时,两款模型已经花了超过 108 万美元,平均每小时 3 万美元。
要是别人干这事得喊一句误闯天家,但是小米干这事只能喊一句误闯米家了。
在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。

见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。


那么目前 MiMo-V2.6 的 Flash 和 Pro 两款模型训练得怎么样了?
其实还在初期,毕竟刚开始训练 1 天多一点。
不过已经能看出两者在 RL 过程中都有了比较明显的能力提升:
Pro 的 dynsam/avg@n 从第 1 步的约 0.565 提升至 0.614,Flash 则从约 0.514 提升至 0.603;最新公开的 DeepSWE v1.1 离线评测中,Pro 和 Flash 分别达到62.24 和 60.77。(对比 DeepSeek-Flash v1.1 是 74.2%)
Flash 从更低的起点快速追近,Pro 目前只保持小幅领先。不过 Pro 训练完一个 Step 更慢,所以最新的评分还没出来。

自 4 月份开源 MiMo-v2.5 后,小米沉默了近半年。
现在负责人罗福莉出来解释,这期间只研究了一件事:强化学习能扩展到多远。

传统的预训练 scaling 很容易理解:更多数据 × 更多参数 × 更多算力 → 更强模型
现在前沿模型越来越关注RL 能不能也这样 scaling?
也就说如果持续增加每轮生成多少轨迹;模型面对多少种真实任务环境;为判断这些轨迹好不好投入多少计算;
模型能力是否还能持续提高?
小米给出的答案是沿三个维度扩展:训练计算量、环境 / 执行框架、评分计算 3 量。
计算量的 Scaling
第一个维度最直观,就是把 RL 本身的计算规模做大。
MiMo-V2.6 系列每个训练 Step 大约会处理20 亿 Token,配置为1568 个 Prompt × 每个 Prompt 16 条 Rollout。
也就是说,同一道题并不是只让模型回答一次,而是让它尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。
1568 × 16 意味着一轮就可能产生超过 2.5 万条 Rollout。而对于 Agent 任务来说,一条 Rollout 又远不只是 " 一问一答 ":模型可能要经历几十轮思考、工具调用、环境反馈和再次行动,因此最终一个 Step 的 Token 数可以达到数十亿级别。

更重要的是,整个系统采用了Fully Async,也就是完全异步的执行方式。
传统意义上可以把一次 RL 训练想象成一条整齐的流水线:先把所有样本生成完,再统一评分,然后训练模型,最后开始下一轮。
但大规模 Agent RL 很难这样等待。
在 MiMo 的系统里,不同任务可以同时处于不同阶段:有的 Agent 还在环境中执行任务,有的已经完成、等待判分,有的正在计算 Reward,还有新的任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成了一套持续运转的异步流水线。

环境的 Scaling
第二个扩展方向是Environments and Harnesses,也就是训练环境和执行框架的扩展。
MiMo-V2.6 做的是 Multi-task Agentic RL:代码、通用任务、视觉、Chat 等不同类型的任务,可以被混合到同一次 RL Run 中训练,而且这些任务还可以运行在不同的 Harness 里。
例如一个编程 Agent 的 Harness 可能允许模型打开终端、修改代码、执行测试、阅读报错,然后继续修改;另一个视觉 Agent 面对的则可能是一套完全不同的工具、环境反馈和成功条件。
因此,MiMo 想扩展的除了 " 题目数量 ",还有模型能够进入多少种环境、使用多少种工具、解决多少种类型的问题。
这也是为什么直播页面会专门展示 Batch Composition:这一栏实际上是在告诉外界,每一个训练 Step 中,模型正在从什么样的任务和环境里获取经验。

评分的 Scaling
第三个 Scaling 方向则更容易被忽略:Grader Compute,也就是给打分本身增加算力。
强化学习需要奖励,但复杂 Agent 任务的奖励 并不像数学选择题那样容易得到。
代码任务还可以运行 Test Case:100 个测试通过了多少个,就可以形成相对客观的反馈。
但面对更开放的 Agent 任务,仅仅判断 " 最终成功还是失败 " 往往远远不够,负责判断模型做得好不好的评分者,同样开始消耗越来越多计算资源。
而这里还有一个更加关键的问题Credit Assignment,也就是信用分配。
假设一个 Agent 为了完成任务连续执行了 40 步:搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务。
如果系统最后只告诉模型一句 " 成功,Reward=1",这个学习信号其实非常粗糙。
因为模型并不知道:前面的 40 步中,究竟哪些动作真正帮助了成功?哪些步骤其实毫无必要?哪一次修改扭转了整个任务?又有哪些动作虽然最后没有导致失败,却实际上是不好的选择?
MiMo 在这次训练中特别提到了Agentic In-group Credit Assignment。目前还没有公布具体算法,但结合 " 同一个 Prompt 生成 16 条 Rollout" 的训练方式,可以理解其基本目标:利用同组多条 Agent 轨迹及其结果,获得比简单的最终成败更加细致的强化学习信号。
同一组任务尝试,哪些行为应该获得更多鼓励、哪些应该减少鼓励,以及如何把这种判断转成训练信号。

这样一来,MiMo 所说的三个 Scaling 方向实际上构成了一套完整体系:
扩展计算量,让模型产生更多经验;扩展环境和 Harness,让模型获得更加多样的经验;更多评分计算量,则负责从这些海量经验中提取更加准确的学习信号。
当预训练的 Scaling 已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个 RL 循环,也变成一台可以持续扩大规模的机器?
不过前来围观的大佬 ViT 大佬给出更直接的翻译:三件事,背后都是算力。

参考链接
[ 1 ] https://mimo.xiaomi.com/rl
[ 2 ] https://x.com/_LuoFuli/status/2100296686719610932
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


