鞭牛士 6小时前
小米发布并开源Xiaomi MiMo-V2.6系列模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

9 月 22 日,小米正式发布并开源 Xiaomi MiMo-V2.6 系列模型。据介绍,该系列包含 Pro 和 Flash 两个原生全模态模型,是小米探索 RSI(递归自我改进)路径的阶段性成果。

在评测数据方面,得益于 RL 算力的扩展,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 46 分。该分数超过 Kimi K3 和 Qwen3.8 Max,成为当前最强开源模型;但对比最强闭源模型 Claude Fable 5.1 和 GPT-6 Astra,仍存在差距。

MiMo-V2.6 系列沿用 V2.5 系列的 API 定价,智能提升但价格不变。官方数据显示,MiMo-V2.6-Pro 在同等智能水平下,价格仅为海外模型的 1/20 至 1/60,刷新了国产模型性价比纪录。

在训练细节上,MiMo-V2.6 进行了为期 6 天的 Live RL 训练。训练成本方面,Flash 与 Pro 分别约 85 万与 262 万美元,各完成 30 步,累计约 75 万条轨迹。训练任务平均通过率分别相对提升 25% 和 12%。在样本外长程软件工程评测基准 DeepSWE v1.1 中,Flash 和 Pro 分别提升约 17 分(48.8 → 65.68)和约 14 分(58.4 → 72.57)。

据官方披露,本次训练主要从三个维度扩展 RL 算力:一是更大的 Batch 与更高吞吐,结合大 Batch 和全异步架构,单次更新使用 1,568 个样本,支持 1M 上下文长度训练,单步训练 Token 达 2.7~3.7B;二是更多任务与复杂环境,构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系,混合多个 Harness;三是更大的 Grader 算力,通过 Group 内相对比较为 Long-Horizon RL 任务提供奖励信号。

在训练稳定性方面,随着训练规模扩大,小米冻结了 MoE Router 以抑制专家负载漂移,并建立了覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的 Reward Hacking 防线。

目前,小米已开源上述技术成果及配套资源,包括完整技术报告、训练环境与 RL 代码,以供研究者复现和验证相关结果。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论