量子位 17小时前
Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

看来啊,老马显然也知道,国庆前后这几天的基模圈不好混。

所以先发先占坑—— Grok 4.7,来了!!!

更大的底模、上下文拉到 50 万 Token,重点猛练 Coding、Agent,以及动辄跑上几个小时的复杂任务。

软件工程、电气工程、长时办公、终端和法律任务全面开花了。

官方评测表中,电气工程基准测试以 64% 拿下第一,终端操作基准测试更从 20.3% 跃升到 38%~

当然了,价格也很感人,输入 2 美元 / 百万 Token,输出 6 美元 / 百万 Token,纯 · 加量不加价了。

谁成想呢,模型刚发布,网友实测画风就开始不对劲了。

Coding?Agent?法律推理?先放一边哈~

大家像提前在群里对过暗号一样,打开 Grok 4.7 后的第一件事居然是——发!火!箭!

这边 @TheHype. 直接整了出「宇宙上天」大戏,别说,这火箭蹿得甚至比隔壁家还快:

还有下面这老哥,直接让 Grok 4.7 给他搓出了一个 3D 火箭工程,模型、发射架都有,甚至还能现场试飞??

还有网友看热闹不嫌事大,干脆把 Kimi K3 和 Grok 4.7 一起拖到火箭发射场,同题开卷!

结果这一轮看下来,Grok 这边多少有点没顶住,直接眩晕瘫坐了,网友不买账了:

老马:都这么玩我是吧??

SpaceX:俺又做错啥了??

Grok 4.7,这波专挑复杂「重活儿」猛练了

一句话概括啊。

Grok 4.7 这波确实是奔着《干重活儿》来的。

从目前公开评测成绩上来看,Grok 4.7 这次的提升算是比较集中,主要还是 Coding、Agent 和长时任务。

先看 xAI 官方自己给出的评测表现。

软件工程 CursorBench   4.0 从上一代的 40.4% 涨到 46.3%,DeepSWE v1.1 也从 65.2% 升到 71%。

电气工程 EEBench 涨得更猛一点——

比上一代提升了 11 个百分点,在表中四款模型里拿下最高分,算是在专业工程任务上的增益算是比较明显。

法律 Agent 这边也从 15.8% 涨到 19.6%,一口气拉开了和表中 GPT-5.6 Sol、Fable 5.1 的差距:

再来看看第三方 Artificial Analysis 榜单。

综合智能指数拿到 46 分,排在第一梯队之后,到了更对口的 Coding Agent Index,成绩直接来到 56 分、位列第 4,相比 Grok 4.6 的 47 分又往前提升了一大截。

Grok 4.7:我超不过隔壁家,我还超不过自己??

当然,Grok 4.7 这次还不只是分数往上涨,性能成本比也一起提升了。

xAI 给出的 CursorBench 4.0 成本曲线里,随着单任务预算增加,Grok 4.7 的成绩还能继续往上爬。

在大约 4~5 美元 / 任务的位置,已经能做到约 43%,继续加预算还能逼近 46%。

看了一下,同等预算下,GPT-5.6 Sol 大约还在 37% 左右,差距有 6 个百分点上下。。。

emm …也说明说明这代模型在复杂 Coding 任务上,多花一点推理预算,确实能更稳定地换回能力增益了??

前脚测完火箭,Grok 4.7 又被网友拉去造游戏、建大桥!

比 Grok 4.7 发布本身更有节目效果的,还得看网友。

前面刚拿它测完火箭,后脚大家已经把 Grok 4.7 拖去各个场景轮番上强度了。

下面是 grok 4.6 和 grok 4.7 的开放游戏世界对比图,确实观感差距比较明显。

4.6 多少还有点像素小游戏那味儿,画面偏平,建模也比较朴素??(自认为)

到了 4.7 建模感明显更强一些,建筑、道路、光影、场景细节都更扎实,已经有点正经 3D 游戏 Demo 的意思了 :

然后,咱看下面这位老哥,直接让 Grok 4.7 搓了个《帝国时代 2》。

从画面细节上看,确实比上一代的建筑细节度更好,但感觉 4.6 的画面颜色更好些,各有千秋吧,大家觉得呢?

再往下,难度继续加码。

有网友直接把 Grok 4.7 扔进 Blender,让它现场建一个金门大桥。

结果全程只花了 17 分钟,近景、远景、特写基本都有,桥体结构和整体画面完成度看着也挺像样。

反正从老哥晒图的架势来看——这耗费的时间,花得相当值!!!

咱们再爱看下面这位友友。

给 Grok 4.7 喂了一段此前的SpaceX 星舰真实发射视频作为参考,让它按照真实素材重新生成一段定格动画。

最终生成的视频整体变成了类似手绘工程草图 / 复古定格动画的风格:

小游戏这边,很快就有人来拆台了。

有网友让 Grok 4.7 和 GPT-6 Astra 各写了一个弹球游戏,然后尴尬的一幕来了——

咱 Grok 这边开局还挺正常,球也能弹、画面也能跑,然后不到 10 秒,球直接卡住不动了。

真 · 大活儿能接,小球难防!!!

算上去,距离全球基模决战的国庆节,已经没几天了。

怎么不算主打一个错峰发布呢?

隔壁 A 社 Claude 5.2 箭在弦上。

谷歌 Gemini 4 Pro 内测效果刷屏,甚至疑似已经披着马甲,偷偷混进 Arena 参加摸底考试了。

国内的厂商也开始陆续往牌桌上加码,国庆前后这几天,怎么看都像是又一轮基模集中交卷期。

这个时间点发咱 Grok 4.7,怎么不算上上策捏?

参考链接:

[ 1 ] https://x.com/SpaceXAI/status/2102069815225586149?s=20

[ 2 ] https://x.com/SpaceXAI/status/2102069817893150777?s=20

[ 3 ] https://x.com/ArtificialAnlys/status/2102074898327932987?s=20

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

电气工程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论