新浪财经 昨天
Meta发布Muse Spark 1.3模型,编码与代理能力大幅跃升
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Meta 超级智能实验室 9 月 2 日发布 Muse Spark 1.3,当日起在终端编码代理 Muse Code 和 Meta Model API 上线。这是五个月内 Muse Spark 系列的第四次迭代,上一代 1.2 于 8 月 5 日与 Muse Code 一同推出。新模型权重保持封闭,既有推理档位同步可用,最高推理档(max)仍需完成额外安全测试后才会开放。

性能对标一线模型,编码与代理是主战场

首席人工智能官亚历山大 · 王对媒体表示,这是迄今最大的模型性能跃升,编码与代理自动化是主攻方向。他称 1.3 与 Anthropic 的 Claude Fable 5.1" 有竞争力 ",编码表现 " 好于 "OpenAI 的 GPT-5.6 Sol。马克 · 扎克伯格在社交媒体上写道,这是 " 编码和代理作业上迄今最大的飞跃 ",并称其拥有 " 便宜到几乎不必计量的前沿性能 "。

相对上一代 1.2,公司工程师内部对比显示工具调用减少约 20%、token 消耗减少约 25%,模型 " 少说废话、少绕不必要的回合 "。上下文窗口维持在 100 万 token,输入支持文本、图像和视频。标准 API 定价未变:每百万 token 输入 1.25 美元、输出 4.25 美元,缓存命中 0.15 美元。贡献者档价格更低,条件为允许 Meta 使用提交内容改进模型。

第三方评测进入第一梯队,max 档仍限合作伙伴

独立评测机构 Artificial Analysis 给公开档 1.3(xhigh)的 Intelligence Index 打出 61 分,与 GPT-5.6 Sol(max)、Grok 4.6(high)并列;面向合作伙伴的 1.3(max)为 62 分,仅次于 Claude Fable 5.1 与 Claude Opus 5。该机构指出,xhigh 在 59 分以上模型里单任务成本最低,约 0.55 美元,同档对手约 0.94 至 0.95 美元。不过,由于代理评测中输入 token 较 1.2 增加约 57%,单任务成本从约 0.40 美元升至 0.55 美元。

在具体基准上,Tau3-Bench Banking 从 1.2 的 35% 升至 xhigh 的 47%、max 的 52%;Terminal-Bench 2.1 从 80% 升至 85%;GDPval-AA v2 Elo 从 1615 升至 xhigh 的 1709、max 的 1754。max 靠更多回合和推理 token 拉分:相对 xhigh,GDPval 推理量约高 62%,Tau3 约高 28%。Meta 自报的 DeepSWE v1.1 为 75.4,对照表中 1.2 为 55、GPT-5.6 Sol 为 73、Claude Opus 5 为 74。两套数字口径不同,不能直接加总比较。

社交产品即将更新,更大模型仍在训练

1.3 将在数日内进入 Facebook、Instagram 和 Meta AI 应用,但公司未给出精确日期。亚历山大 · 王称定价 " 进取 ",安全与对齐投入已明显加码," 还没有被迫暂停,但要确保不撞到护栏 "。更大代号为 Watermelon 的模型仍在开发,发布时间未定。扎克伯格此前曾表示会开源某一代 Spark 权重,但本版仍为闭源收费接口。

五个月内四次发布,将 Meta 从落后一档推到与 Claude Fable、GPT-5.6、Grok 同场比较的位置。目前公开可用的是 xhigh 档,而非性能更高的 max 档。价格锁定在 1.2 水平,但代理任务导致的 token 消耗上升,意味着实际使用成本可能增加。下一次可核对的时间点,是 max 档完成安全测试并开放,以及社交产品中的实际替换进展。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

muse 扎克伯格 亚历山大 人工智能 自动化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论