看来啊,老马显然也知道,国庆前后这几天的基模圈不好混。
所以先发先占坑—— Grok 4.7,来了!!!
更大的底模、上下文拉到 50 万 Token,重点猛练 Coding、Agent,以及动辄跑上几个小时的复杂任务。
软件工程、电气工程、长时办公、终端和法律任务全面开花了。
官方评测表中,电气工程基准测试以 64% 拿下第一,终端操作基准测试更从 20.3% 跃升到 38%~
当然了,价格也很感人,输入 2 美元 / 百万 Token,输出 6 美元 / 百万 Token,纯 · 加量不加价了。
谁成想呢,模型刚发布,网友实测画风就开始不对劲了。
Coding?Agent?法律推理?先放一边哈~
大家像提前在群里对过暗号一样,打开 Grok 4.7 后的第一件事居然是——发!火!箭!
这边 @TheHype. 直接整了出「宇宙上天」大戏,别说,这火箭蹿得甚至比隔壁家还快:
还有下面这老哥,直接让 Grok 4.7 给他搓出了一个 3D 火箭工程,模型、发射架都有,甚至还能现场试飞??
还有网友看热闹不嫌事大,干脆把 Kimi K3 和 Grok 4.7 一起拖到火箭发射场,同题开卷!
结果这一轮看下来,Grok 这边多少有点没顶住,直接眩晕瘫坐了,网友不买账了:
老马:都这么玩我是吧??
SpaceX:俺又做错啥了??
Grok 4.7,这波专挑复杂「重活儿」猛练了
一句话概括啊。
Grok 4.7 这波确实是奔着《干重活儿》来的。
从目前公开评测成绩上来看,Grok 4.7 这次的提升算是比较集中,主要还是 Coding、Agent 和长时任务。
先看 xAI 官方自己给出的评测表现。
软件工程 CursorBench 4.0 从上一代的 40.4% 涨到 46.3%,DeepSWE v1.1 也从 65.2% 升到 71%。
电气工程 EEBench 涨得更猛一点——
比上一代提升了 11 个百分点,在表中四款模型里拿下最高分,算是在专业工程任务上的增益算是比较明显。
法律 Agent 这边也从 15.8% 涨到 19.6%,一口气拉开了和表中 GPT-5.6 Sol、Fable 5.1 的差距:
再来看看第三方 Artificial Analysis 榜单。
综合智能指数拿到 46 分,排在第一梯队之后,到了更对口的 Coding Agent Index,成绩直接来到 56 分、位列第 4,相比 Grok 4.6 的 47 分又往前提升了一大截。
Grok 4.7:我超不过隔壁家,我还超不过自己??
当然,Grok 4.7 这次还不只是分数往上涨,性能成本比也一起提升了。
xAI 给出的 CursorBench 4.0 成本曲线里,随着单任务预算增加,Grok 4.7 的成绩还能继续往上爬。
在大约 4~5 美元 / 任务的位置,已经能做到约 43%,继续加预算还能逼近 46%。
看了一下,同等预算下,GPT-5.6 Sol 大约还在 37% 左右,差距有 6 个百分点上下。。。
emm …也说明说明这代模型在复杂 Coding 任务上,多花一点推理预算,确实能更稳定地换回能力增益了??
前脚测完火箭,Grok 4.7 又被网友拉去造游戏、建大桥!
比 Grok 4.7 发布本身更有节目效果的,还得看网友。
前面刚拿它测完火箭,后脚大家已经把 Grok 4.7 拖去各个场景轮番上强度了。
下面是 grok 4.6 和 grok 4.7 的开放游戏世界对比图,确实观感差距比较明显。
4.6 多少还有点像素小游戏那味儿,画面偏平,建模也比较朴素??(自认为)
到了 4.7 建模感明显更强一些,建筑、道路、光影、场景细节都更扎实,已经有点正经 3D 游戏 Demo 的意思了 :
然后,咱看下面这位老哥,直接让 Grok 4.7 搓了个《帝国时代 2》。
从画面细节上看,确实比上一代的建筑细节度更好,但感觉 4.6 的画面颜色更好些,各有千秋吧,大家觉得呢?
再往下,难度继续加码。
有网友直接把 Grok 4.7 扔进 Blender,让它现场建一个金门大桥。
结果全程只花了 17 分钟,近景、远景、特写基本都有,桥体结构和整体画面完成度看着也挺像样。
反正从老哥晒图的架势来看——这耗费的时间,花得相当值!!!
咱们再爱看下面这位友友。
给 Grok 4.7 喂了一段此前的SpaceX 星舰真实发射视频作为参考,让它按照真实素材重新生成一段定格动画。
最终生成的视频整体变成了类似手绘工程草图 / 复古定格动画的风格:
小游戏这边,很快就有人来拆台了。
有网友让 Grok 4.7 和 GPT-6 Astra 各写了一个弹球游戏,然后尴尬的一幕来了——
咱 Grok 这边开局还挺正常,球也能弹、画面也能跑,然后不到 10 秒,球直接卡住不动了。
真 · 大活儿能接,小球难防!!!
算上去,距离全球基模决战的国庆节,已经没几天了。
怎么不算主打一个错峰发布呢?
隔壁 A 社 Claude 5.2 箭在弦上。
谷歌 Gemini 4 Pro 内测效果刷屏,甚至疑似已经披着马甲,偷偷混进 Arena 参加摸底考试了。
国内的厂商也开始陆续往牌桌上加码,国庆前后这几天,怎么看都像是又一轮基模集中交卷期。
这个时间点发咱 Grok 4.7,怎么不算上上策捏?
参考链接:
[ 1 ] https://x.com/SpaceXAI/status/2102069815225586149?s=20
[ 2 ] https://x.com/SpaceXAI/status/2102069817893150777?s=20
[ 3 ] https://x.com/ArtificialAnlys/status/2102074898327932987?s=20
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦