智东西 19小时前
昨夜,马斯克甩出Grok 4.6!性能直逼Fable 5,英伟达祝贺
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

编译 | ZeR0

编辑 | 漠影

智东西 8 月 13 日消息,昨夜,马斯克转发 SpaceXAI 推文,宣布推出新一代旗舰模型 Grok 4.6,它具有智能、快速、性价比超高的特点。

相比 Grok 4.5,Grok 4.6 在相同价格下性能显著优化。从其披露的多项智能体编程和知识工作基准测试来看,Grok 4.6 high 综合性能与 GPT-5.6 Sol Max、Claude Fable 5 Max 相当。

英伟达第一时间在评论区留言 " 恭喜发布 "。

Grok 4.6 现已在 Cursor 和 Grok Build 上发布,也已在 API 和其他合作伙伴(如 OpenRouter、Vercel 和 Cloudflare)的平台上发布。首周,Grok Build 和 Cursor 内均提供2 倍的使用量,让用户可立即体验 4.6 版本。

其定价为每百万输入 token 2 美元(约合人民币 13 元),每百万输出 token6 美元(约合人民币 40 元),还有一种快速版本的价格是普通版本的2 倍

在最新披露的 Code Arena 代码竞技场 WebDev 测试结果中,Grok 4.6 ( High ) 以 1618 分数排名第七,与 GPT-5.6 Sol ( xHigh ) 、GLM-5.2 ( Max ) 、Claude Fable 5 分数十分接近。

Grok 4.6 在 Grok 4.5 的基础上进行了改进,特别注重长期运行的智能体以及更具挑战性的交互式和视觉化工作,能处理多步骤的复杂任务,包括研究主题、分析信息、跨代码库工作、将想法转化为完善的应用程序或作品等。

与 Grok 4.5 相比,Grok 4.6 进行了更长时间的补充训练,使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,以及改进的优化器和训练方案。这为后续的 SFT 和 RL 阶段奠定了更坚实的基础。

然后,研发团队使用 Grok 4.5 重新生成了 SFT 在推理过程、智能体框架以及 STEM、软件工程和知识工作等领域中的轨迹,并通过基于模型的检查过滤掉了问题轨迹。最终得到的 SFT 检查点展现出优异的性能和改进的行为。

Grok 4.6 经过广泛的智能强化学习任务训练,包括知识工作、通用编码以及核优化、Web 开发、计算机辅助设计等领域的特定环境。

SpaceXAI 团队对 Grok 4.6 进行了测试,旨在拓展其应用范围,并检验其在多步骤工作中持续改进的能力,发现该模型尤其擅长将宽泛的产品构想转化为可运行的初始版本。它能够研究陌生的领域,构建应用程序框架,实现核心交互,并通过多轮反馈不断完善最终成果。

在更长的轨迹上,他们也开始看到更多的自我测试和验证,模型会在继续前进之前检查自己的工作。

与 Grok 4.5 相比,Grok 4.6 在视觉和交互项目的第一阶段就能生成更强大的成果。给定一个具体的产品构想,它只需一次迭代即可为应用程序构建结构和视觉语言。

这使得它对于那些需要先构建一个实质性框架,然后不断迭代才能快速取得理想结果的项目尤为有用。

同时,Grok 4.6 的安全防护措施已根据模型的功能进行了改进和校准。其安全堆栈旨在最大限度地提高合法使用场景的实用性和安全性,使 Grok 4.6 能在漏洞修补、加速工程设计周期和增强 AI 研究等领域发挥作用并保障安全。

来源:SpaceXAI

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 马斯克 智东西 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论