【CNMO 科技消息】马斯克旗下的人工智能公司 SpaceXAI 日前发布了新一代前沿模型 Grok 4.6,重点面向长时间运行的智能体、编程和知识工作场景,并采用更具竞争力的定价策略来降低这些工作负载的运行成本。

Grok
在第三方评测机构 Artificial Analysis 的智能指数中,Grok 4.6 得分 61,超越月之暗面的开源模型 Kimi K3,与 OpenAI 的 GPT-5.6 Sol Max 持平,相比上一代 Grok 4.5 提升 5 分。目前榜单前两名分别由 Anthropic 的 Claude Opus 5 和 Claude Fable 5 占据,Grok 4.6 与 GPT-5.6 Sol Max 并列全球第三。
编程和智能体能力是 Grok 4.6 升级的重头戏。在 DeepSWE v1.1 基准测试中,其得分从 54% 跃升至 65.9%;APEX-Agents 智能体基准从 47.1% 升至 57.5%,提升 10.4 个百分点,略超 GPT-5.6 Sol Max 的 56.7%;Terminal-Bench v3.0 也从 15.7% 提升至 26%。不过在后两项测试中,Claude Fable 5 Max 仍保持领先,说明 Grok 4.6 虽然进步明显,但尚未实现对竞争对手的全面压制。
定价方面,Grok 4.6 的 API 起步价为每百万输入 token 2 美元、每百万输出 token 6 美元,处于前沿模型的中档价位,不到 GPT-5.6 Sol 标准模式价格的一半。模型支持 50 万 token 的上下文窗口,提示词低于 20 万 token 时按上述价格计费,达到 20 万 token 后费率将上调。据 SpaceXAI 介绍,Grok 4.6 今日起已在 Grok Build 中上线,并同步登陆其收购的 AI 编程公司 Cursor,合作方还包括 OpenRouter、Vercel 和 Cloudflare 等。
在训练层面,SpaceXAI 表示,相比 Grok 4.5,Grok 4.6 进行了更长时间的训练,并针对通用编程、知识工作、内核优化、网页开发和计算机辅助设计等智能体环境强化了强化学习。测试中,Grok 4.6 在长序列任务中展现出更强的自我测试和验证能力。从成本效率看,Artificial Analysis 数据显示,Grok 4.6 完成 AA-Briefcase 工作负载平均仅需约 53 轮交互和 5 亿输入 token,而 Claude Opus 5 Max 约为 103 轮和 20 亿 token,前者的效率优势相当明显。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦