每日经济新闻 5小时前
小米凌晨发布并开源Xiaomi MiMo-V2.6系列大模型 沿用V2.5系列的API定价
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

9 月 22 日凌晨,小米方面发布并开源了 Xiaomi MiMo-V2.6 系列大模型。根据小米方面的说法,这是其探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力。

根据官方介绍,MiMo-V2.6 系列包含 Pro 和 Flash 两个原生全模态模型。其中,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型;但与最强的闭源模型 Claude Fable 5.1 和 GPT-6 Astra 相比,仍有差距。

价格方面,MiMo-V2.6 系列沿用 V2.5 系列的 API 定价。值得一提的是,就在几日前的凌晨(9 月 17 日),小米 MiMo 大模型团队负责人罗福莉在 X 平台分享了 MiMo-V2.6 的实时训练页面,这也是外界首次看到这一代模型强化学习阶段的部分训练状态。

罗福莉公开的训练页面中包含两个版本,分别是 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。根据当时的统计数据,MiMo-V2.6-Pro 训练时长为 1 天 19 小时,耗费 89 万美元,平均每小时耗费超 2 万美元;MiMo-V2.6-Flash 训练时长 1 天 14 小时,耗费 39.7 万美元,平均每小时耗费超 1 万美元。综合计算,两个版本训练合计每小时花费约 3.1 万美元。

小米方面称,此次训练主要从三个维度扩展了 RL 算力,支持 1M 上下文长度训练,单步训练 Token 达 2.7~3.7B。构建了覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系,并混合多个 Harness;通过 Group 内相对比较,为 Long-Horizon RL 任务提供更精准、多样的奖励信号,形成模型自我改进闭环,并引导模型以更短路径、更少 Token 完成任务。小米方面称,公司已开源上述技术成果及配套资源,包括完整技术报告、训练环境与 RL 代码。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论