量子位 昨天
Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

小扎去年撒出去的那些钱,好像终于开始听见响了……

Meta 刚刚端出的新模型Muse Spark 1.3,已经和Fable 5掰上手腕了。

Artificial Analysis 最新榜单里,Muse Spark 1.3 Max 拿到62分。

跟 Fable 5、5.1 xhigh 打了个平手。

再往细项里扒,Coding 和 Agent 这边 Muse Spark 1.3 已经开始在综合评分比自己高的 Opus5 max 面前冒头。

这事儿搁 Meta 身上,节目效果就不太一样了。

在 Llama 之后,Meta 在顶流大模型赛道沉寂挺久,一度被对手甩开一大截。

就在不久前,小扎去年花重金攒起来的超级智能团队,还经历了余家辉离职的 " 变故 "。

去年还在满硅谷挥着支票薅人,今年先跑了个核心研究员,这支高价攒出来的队伍,不会要高开低走吧?

正当大家继续围观这支天价团队后续剧情时——

新模型先上桌了。

Muse Spark 1.3:能肝,还贼便宜

9 月 2 日,Meta 正式发布Muse Spark 1.3

这是 Muse Spark 今年 4 月亮相之后,短短几个月里的第四个版本。

4 月,初代 Muse Spark;7 月,1.1;8 月,1.2;现在刚进 9 月,1.3 又续上了。

小扎这次也亲自营业,称 Muse Spark 1.3 是目前整个系列在Coding 和 Agent工作上幅度最大的一次提升。

还放狠话,性能已经强到——

便宜得几乎都没必要算账了。

按自家给出的内部对比里,Muse Spark 1.3 比 1.2平均减少了约 20% 的工具调用和 25% 的 Token 消耗,同时会少浪费一些无效轮次,在长程任务里也更能记住一开始的要求。

网友也纷纷开始实测。

比如拿 Muse Spark 1.3 和 1.2 做一轮同 Prompt 对比。

一次性生成一个自包含 HTML 文件,在里面搓出三件可收藏的 3D 维京手办,维京头盔、镶钻战斧,以及一艘载着船员的长船。

成本差不多,一个 0.08 美元,一个 0.1 美元,但 1.3 做出来的细节质感明显高出一截。

还有网友直接把 Muse Spark 1.3 Ultra Contributor 和 Fable 5.1 xHigh 拉来折腾了差不多两个小时。

两边拿到同一个 Prompt,但里面专门塞了一条相当折腾模型的规则:

每次完成之后,都交给独立 Judge 打分。不到 9.5/10 不准停,继续自己改。

然后 Muse Spark 1.3 真就没停……两小时里,它连续跑了 20 轮自我改进,每一轮又启动 3 个 Agent,算下来就是一共 60+ 次 Agent 运行。

而且全程花费不到 1 美元。

总结下来就是:真能肝,真能省

Muse Spark 1.3 标准 API 价格仍然和 1.2 保持一致:

输入 1.25 美元 / 百万 Token,输出 4.25 美元 / 百万 Token,缓存输入 0.15 美元。

Artificial Analysis 算下来,1.3 xhigh 每个 Intelligence Index 任务的成本约 0.55 美元。

同一档附近的 GPT-5.6 Sol Max 和 Grok 4.6 High 分别约 0.95 美元和 0.94 美元。

而且,Muse Spark 本身还只是 Muse 系列里更轻量的一条模型线,后面还有更大的模型。

小扎这次发完 1.3,也没忘了继续预告两件事:

Muse Spark 开放权重,即将到来。

以及那个已经吊了大家不知道多久胃口的:。

曾经一度在前沿模型竞争里显得有点安静的 Meta,又开始往桌子中央挤了。

Muse Spark 这几个月突然加速的另一面,是小扎去年那场轰轰烈烈的抢人大战,也终于到了看成果的时候。

小扎去年薅来的那帮人,开始交作业了

去年夏天,Meta 组建超级智能实验室,小扎满硅谷挖牛人。

其中相当受关注的一批研究员,就是从 OpenAI 过去的赵晟佳、余家辉、任泓宇、毕树超等人。

各种天价 package 传闻满天飞,所有人都在吃瓜:

这支豪华班子究竟能搞出什么黑科技?

谁料黑科技还没来,剧情先拐了一下,余家辉宣布离开 Meta 创业。

一位核心研究员离开,自然让外界重新开始打量这支组建时间并不算长的明星团队。

不过现在再看,进度没落下。

而且新版本一出,几位核心研究员也纷纷出来爆料背后改动。

赵晟佳直接把 Muse Spark 1.3 称为目前 Spark 模型线里最强的 Coding 和 Agent 模型。

他特别提到了三个方向:

更长程的工作、更强的 Agent 任务能力,以及更可靠地遵循复杂指令。

毕树超披露的东西则更底层一点。

这次团队在训练阶段投入了更多算力做结果评分矫正

针对性解决模型偷懒划水、指令执行偏差、含糊回避作答,还有奖励投机、奖励黑客等问题。

经过这轮处理之后,模型的可用性有了非常明显的提升。

虽然 Muse Spark 1.3 挺猛,但小扎显然还没准备把牌一次打完。

那个已经预告不知道多少次、到现在还没切开的,到底还能整出多大动静……蹲蹲蹲。

参考链接:

[ 1 ] https://x.com/finkd/status/2095232032896946311?s=20

[ 2 ] https://x.com/aimlapi/status/2095248072154701847?s=20

[ 3 ] https://x.com/SPAC89/status/2095284969614475744?s=20

[ 4 ] https://x.com/shengjia_zhao/status/2095233023247880590?s=20

[ 5 ] https://x.com/shuchaobi/status/2095234300199543121?s=20

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

评论
大家都在看