Meta 超级智能实验室 9 月 2 日发布 Muse Spark 1.3,当日起在终端编码代理 Muse Code 和 Meta Model API 上线。这是五个月内 Muse Spark 系列的第四次迭代,上一代 1.2 于 8 月 5 日与 Muse Code 一同推出。新模型权重保持封闭,既有推理档位同步可用,最高推理档(max)仍需完成额外安全测试后才会开放。
性能对标一线模型,编码与代理是主战场
首席人工智能官亚历山大 · 王对媒体表示,这是迄今最大的模型性能跃升,编码与代理自动化是主攻方向。他称 1.3 与 Anthropic 的 Claude Fable 5.1" 有竞争力 ",编码表现 " 好于 "OpenAI 的 GPT-5.6 Sol。马克 · 扎克伯格在社交媒体上写道,这是 " 编码和代理作业上迄今最大的飞跃 ",并称其拥有 " 便宜到几乎不必计量的前沿性能 "。
相对上一代 1.2,公司工程师内部对比显示工具调用减少约 20%、token 消耗减少约 25%,模型 " 少说废话、少绕不必要的回合 "。上下文窗口维持在 100 万 token,输入支持文本、图像和视频。标准 API 定价未变:每百万 token 输入 1.25 美元、输出 4.25 美元,缓存命中 0.15 美元。贡献者档价格更低,条件为允许 Meta 使用提交内容改进模型。
第三方评测进入第一梯队,max 档仍限合作伙伴
独立评测机构 Artificial Analysis 给公开档 1.3(xhigh)的 Intelligence Index 打出 61 分,与 GPT-5.6 Sol(max)、Grok 4.6(high)并列;面向合作伙伴的 1.3(max)为 62 分,仅次于 Claude Fable 5.1 与 Claude Opus 5。该机构指出,xhigh 在 59 分以上模型里单任务成本最低,约 0.55 美元,同档对手约 0.94 至 0.95 美元。不过,由于代理评测中输入 token 较 1.2 增加约 57%,单任务成本从约 0.40 美元升至 0.55 美元。
在具体基准上,Tau3-Bench Banking 从 1.2 的 35% 升至 xhigh 的 47%、max 的 52%;Terminal-Bench 2.1 从 80% 升至 85%;GDPval-AA v2 Elo 从 1615 升至 xhigh 的 1709、max 的 1754。max 靠更多回合和推理 token 拉分:相对 xhigh,GDPval 推理量约高 62%,Tau3 约高 28%。Meta 自报的 DeepSWE v1.1 为 75.4,对照表中 1.2 为 55、GPT-5.6 Sol 为 73、Claude Opus 5 为 74。两套数字口径不同,不能直接加总比较。
社交产品即将更新,更大模型仍在训练
1.3 将在数日内进入 Facebook、Instagram 和 Meta AI 应用,但公司未给出精确日期。亚历山大 · 王称定价 " 进取 ",安全与对齐投入已明显加码," 还没有被迫暂停,但要确保不撞到护栏 "。更大代号为 Watermelon 的模型仍在开发,发布时间未定。扎克伯格此前曾表示会开源某一代 Spark 权重,但本版仍为闭源收费接口。
五个月内四次发布,将 Meta 从落后一档推到与 Claude Fable、GPT-5.6、Grok 同场比较的位置。目前公开可用的是 xhigh 档,而非性能更高的 max 档。价格锁定在 1.2 水平,但代理任务导致的 token 消耗上升,意味着实际使用成本可能增加。下一次可核对的时间点,是 max 档完成安全测试并开放,以及社交产品中的实际替换进展。


登录后才可以发布评论哦
打开小程序可以发布评论哦