大模型的路,真要被小米走通了?
就在昨天,小米最新一代模型 MiMo-V2.6 新鲜出炉。
这回,MiMo-V2.6 掏出了三个版本:Pro 负责冲性能,Flash 兼顾速度和成本,UltraSpeed 则把 Pro 的输出速度最高提升了 20 倍。Pro 和 Flash 都是原生全模态,能看图、写代码、调工具、操控电脑等等。
不过一说到大模型绕不开的跑分,MiMo 这个图看得世超是真有点痛苦,总感觉少了些什么。。。

因为表面看起来,MiMo-V2.6 在编程、通用智能体、视觉、网络安全四个维度上,除了干不过 GPT 6 Astra、Claude Fable 5 一类的顶级闭源模型,在开源模型里面位列前筹。
但问题是,榜单里基本没有出现 DeepSeek V4.1 Pro、GLM 5.3 等开源旗舰的身影,实在是不好琢磨出 MiMo 的深浅。。。
当然,价格上 MiMo 还是延续了以往一贯的真香。以旗舰模型 MiMo-V2.6-Pro 为例,缓存命中情况下输入每百万 token 0.025 元,缓存未命中 3 元,输出每百万 token 6 元。

而 DeepSeek-V4-Pro 的价格在空闲时段,对应分别是 0.15 、4.5、13.5 元。
相比起来,MiMo 要便宜 33% ~ 83%,不得不说性价比还是很高的。
而这次 MiMo-V2.6 最大的特点,当属它的超大规模强化学习后训练了。
拿 MiMo 负责人罗福莉的话来讲,MiMo-V2.6 属于是他们的探索之作,主要是为了研究强化学习究竟能让模型变得多强。MiMo-V2.6 也可能是开源模型中,迄今为止单次强化学习计算量最大的项目之一。

一次参数更新,就要让模型在真实环境里完成约 2.5 万次长程任务。在经过 30 步训练后,pro 和 flash 都被足足喂了 75 万条长程轨迹,这理论上对模型的 Agent 能力非常有帮助。
但理论归理论,世超去网上翻了一圈,大家对它的实际评价只能说褒贬不一。
有人反映 MiMo-V2.6-Pro 干活速度太慢,总是触发雷霆大思考的。就算能力上应该和 GLM 5.3 差不多,体感也很一般。

也有人说 MiMo 系列其实还是性价比的王,看似无人在意,实则周围不少人都在用它干脏活累活。

为了看看模型到底表现如何,世超也立刻上手试了试。
实际体验下来,我只想说,慢是真的慢,但 MiMo 效果还不错。
在官方案例里,MiMo-V2.6 下能做 3D 游戏、编音乐写 PPT,上能 Blender 建模、搞科学研究。
世超先给了 MiMo-V2.6-Pro 一张最近很火的 " 准点下班 " 截图,让它也做出一个类似的潜行游戏。你还真别说,成品的可玩性挺高的。

氛围场景上,这昏黄的日光、时不时弹出过方案的对话、电脑上 " 今晚走不了 " 的桌面,很有职场恐怖片那味儿。
玩法上,有按 shift 加速,按 E 躲桌子,C 键下蹲,左下角甚至还有小地图,细节也做得挺好。
全程花了 18 分半,世超感觉稍微偏慢,但还可以接受。
随后世超又试了一个 Blender 建模,给了 MiMo-V2.6-Pro 一张宝马车的图片,让它照着做一个 3D 的。

这个就比较漫长了,世超等了一个半小时都没结果。回去翻翻 MiMo 的思考过程,它才到 " 有进步,已经像车了 " 的程度,一度让世超十分绝望。

但在打开 Blender 验收半成品的时候,也许是预期不太高,世超感觉 MiMo 做得效果还行,至少整体感觉出来了,只是有些形状不太对。

但 MiMo 也没说放弃,它还在对比原图,思考怎么优化侧面和车尾。

其实吧,到这里世超感觉,MiMo-V2.6-Pro 至少没有为了速度把质量不达标的东西交给我,倒也可以接受。这可能也是长程轨迹强化学习的福报了。
最后,世超又试了试一些常规的 PPT 制作、网页前端之类的功能。
不得不说,在这种看起来没啥难度的任务上,MiMo 速度确实慢。。。一个 PPT 足足做了 37 分钟,给世超都等力竭了。
好在最终效果不差,大伙儿可以锐评一下属于什么档次:

向下划动
不过,说完了中规中矩的模型效果,其实世超更想说说他们之前的模型训练直播。
大伙儿可能有所耳闻,从 9 月 15 号开始,小米公开直播了 MiMo V2.6 系列中后段的强化学习训练的全过程,MiMo-V2.6 算是大伙儿看着长大的。
从公开日志看,模型的训练并不是一帆风顺,这锅丹中途真炸过好几次。
Pro 先后撞上单节点显存异常、训练集群与评分器断网、还因为专家负载不均触发 GPU Out of Memory 等等问题。
团队的做法是见招拆招,不断调整训练并行策略,移除出现异常的数据,后期又筛掉了对 Pro 来说过于简单的任务,把算力集中到真正有学习价值的样本上,才让模型性能继续往上爬。
虽然直播也一直被质疑,到底是真实训练还是过程回放,但对世超来说,这确实是第一次这么直观地感受到,大模型是怎么一小时烧掉几万美元的。。。
总的来说,MiMo 从零开始,一年半做出能跟上 Agent 时代的 MiMo-V2.6,世超感觉他们还是挺未来可期的。
而且至少从技术博客和训练直播来看,技术团队还在不断探索中,MiMo 还属于起步的成长阶段。
但在另一方面,围绕它的炒作争议也相当激烈。
至于是真有水平还是概念炒作,也许只能让时间来证明了。
撰文:莫莫莫甜甜



登录后才可以发布评论哦
打开小程序可以发布评论哦