钛媒体 昨天
Grok 4.6上了牌桌,马斯克还差一部《奥德赛》
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 | AIX 财经,作者 | 陈丹,编辑 | 魏佳

马斯克想让 Grok 在今年年底前拍完一部《奥德赛》。

这听起来像一个典型的马斯克式 Flag:用 AI 挑战诺兰、好莱坞和 2.5 亿美元制作预算。但真正值得关注的,并不是 Grok 能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。

Grok 4.6 发布后,这个问题有了更具体的答案。

在最新一轮模型竞争中,它已经挤进美国大模型的第一梯队:能力接近 OpenAI 和 Anthropic 的旗舰模型,编程成绩甚至在部分榜单领先,API 价格却明显更低。与此同时,它在长链条 Agent 任务上的短板依然存在——会理解问题、会搭框架、会快速启动,却还不够稳定地收尾。

这恰好也是眼下大模型竞争的缩影。

当能力差距缩小、Token 越来越便宜,真正决定商业价值的,已经不只是 " 模型有多聪明 ",还要看一次任务能否稳定完成,以及完成一次到底要花多少钱。

对于一年向 AI 投入上百亿美元资本开支的马斯克来说,Grok 也不能只是偶尔冲上一次榜单。它必须持续留在第一牌桌,并把算力、数据和分发真正变成收入。

01.Grok 4.6 上了牌桌,但还拍不了《奥德赛》

诺兰的《奥德赛》上映前,马斯克已经骂了这部电影好几轮。骂选角,骂改编,骂诺兰为了奥斯卡 " 亵渎荷马 "。电影上映后,他干脆在 X 上立了一个 Flag,今年年底前,Grok Imagine 要做出一部 " 符合历史、忠于荷马艺术 " 的完整《奥德赛》。

马斯克转发的三分钟《奥德赛》短片确实不错。盔甲、海岸、人物特写都有电影预告片的质感,但三分钟精修短片和九十分钟长片之间,还隔着几千个镜头,以及一群 AI 演员。

趁着 Grok 4.6 发布,我们没有再测试视频,而是给它出了两道更适合语言模型的题。第一道,看它能不能读懂荷马。第二道,看它能不能搭出一套把三分钟样片扩展成九十分钟长片的制片系统。

第一题,Grok 答得比马斯克本人靠谱。

" 符合历史 " 和 " 忠于荷马 " 听起来不难,真翻开《奥德赛》就会发现,这两个维度很难同时实现。《奥德赛》经过数百年口述传播,青铜时代的武器、铁器时代的习俗和诗人的神话想象全叠在一起。你可以考证奥德修斯该用什么剑、坐什么船,却没法从遗址里挖出独眼巨人、女神和冥界。

Grok 把问题拆成了四层,青铜时代考古、荷马史诗里的混合时间层、作品本身的诗学,以及诺兰的现代改编。

它给出的办法是,考古负责约束器物、服装和地理,荷马负责约束人物、叙事和诗学。它还顺手纠正了一个流传很广的错误,「让千艘战船起航的面孔」出自马洛,不是荷马。

这题说明 Grok 4.6 不仅会查资料,还能拆开一个内部冲突的命题,替争议双方构造最强论证。

第二题更接近真正的制片工作。

Grok 搭了一个《奥德赛》制片计算器,把成片时长、平均镜头长度、首轮可用率、复杂镜头占比、并发任务数、人工审核时间、成本和工期全部做成可调参数。

Grok4.6 生成的电影制片系统

按照默认参数,它估算一部 90 分钟长片需要约 208 个工作日。Grok 自己算完都觉得有点悬,最后给出了一条 " 识时务 " 的建议:做一部 12 到 20 分钟的荷马选篇。

当然,208 天不能当作实测结果。首轮可用率、连续性失败率、每个可用镜头需要生成几次,都是模型设定的假设。计算器证明 Grok 会拆解工程、建立公式和搭建生产系统,没有证明这套系统真的能在 208 天内交片。

而且,它点出了 AI 电影最难的部分。现在生成一个漂亮镜头已经不稀奇。难的是让几千个镜头中的脸、衣服、船只、空间和叙事保持一致,同时把废片、重做和人工审核压到制片方能承受的范围。

外部榜单给出的结论差不多。

在 Artificial Analysis 的榜单上,Grok 4.6 的综合智能指数是 61 分,与 GPT-5.6 Sol 同分,距离 Claude Fable 5 只有 1 分。CursorBench 3.2 上,Grok 4.6 High 拿到 69.9%,超过 Sol 的 67.2%。它完成一次任务的成本约 2.34 美元,Sol 约 5.69 美元。Grok 4.6 的 API 的起价在每百万输入 Token 2 美元、输出 6 美元——价格确实有杀伤力。

图源 / SpaceX

但到了 DeepSWE 和 TerminalBench 这类长链条任务,Grok 分别拿到 65.9% 和 26%。Sol 是 73% 和 34.6%,Fable 5 是 70% 和 34.1%。

Grok 已经很会理解问题、启动项目和搭建框架,到了需要连续执行、处理意外和稳定收尾的阶段,仍然会掉链子。

综合来看,Grok 4.6 已经坐上美国大模型的第一桌,而且在 OpenAI 和 Anthropic 旗舰模型面前,打出了一张很凶的性价比牌。

它会读荷马,会写分镜,会算工期,也会搭制片系统。只是奥德修斯漂了十年才回到伊萨卡,想让 Grok 在年底前带着几千个连续镜头顺利 " 返乡 ",现在看还很难。

02.35 天一代,马斯克先要确保 Grok 别掉队

从 7 月 8 日 Grok 4.5 开始对外推送,到 8 月 12 日 Grok 4.6 发布,中间只隔了 35 天。马斯克还预告,拥有 2.1 万亿参数的 Grok 4.7 将在几周后到来,能力更强,Token 效率更高,只是推理稍慢。

4.7 还没发布,参数和能力也只有马斯克一家的说法,但 4.5 到 4.6 至少完成了一次有效的月度升级。如果 4.7 按时落地,SpaceXAI 就更显示出自己能够停留在第一梯队的能力。

这件事放在两年前,还有点难以想象。

2023 年 11 月,Grok-1 发布时,OpenAI 已经拿出 GPT-4,Anthropic 已经发布 Claude,Google 背后则有 TPU、搜索和云。那时候,Grok 更像 X Premium 附赠的聊天机器人,企业客户、开发者生态和模型透明度都没建立起来,B 端的市场占有率也很低。今年 4 月,在 Ramp 客户的企业付费样本里,xAI 的采用率只有 1.9%,而 Anthropic 和 OpenAI 的这一数字分别是 34.4% 和 32.3%。

在很多从业者的眼中,和 Meta 一样,SpaceXAI 的大模型也长期困于第二梯队。

但现在 Grok 端着凳子挤过来了。它能追上来,主要是大力出奇迹,靠算力、数据和工程速度一起硬堆。

xAI 用 122 天建成了首期 10 万张 Hopper GPU 的 Colossus,随后又用 92 天扩到 20 万张。服务器到场 19 天后,集群已经开始跑训练任务。黄仁勋把这段部署速度称为 " 超人级 "。X 给 Grok 提供实时信息、用户和分发入口。Cursor 则提供真实的编程任务和开发者与 Agent 的交互数据。Cursor 称,Grok 4.5 的训练使用了数万亿 Token 的 Cursor 数据。

模型也不必每个月从头练一遍。Grok 4.6 建立在 4.5 的基础上,主要升级监督微调、强化学习和 Agent 训练环境。Colossus 负责把训练规模堆上去,X 和 Cursor 负责不断喂回真实任务,SpaceXAI 再用后训练把这些任务压进下一版模型。

这套流水线跑顺以后,版本号就能按月往前拱。

Grok 也必须跑这么快,因为 SpaceX 已经把太多钱押在 AI 上了。

SpaceX 招股书显示,2025 年 AI 分部收入 32 亿美元,经营亏损 64 亿美元,资本开支 127 亿美元,占公司总资本开支约 61%。2026 年一季度,SpaceX 又向 AI 分部投入 77 亿美元,占全公司资本开支的 76%。到了 2026 年二季度,AI 分部资本开支进一步升至 158.28 亿美元,占三大分部资本开支的约 86%,单季已经超过 2025 年全年;上半年累计达到 236 亿美元。

SpaceX 给投资者讲的故事已经很明确。公司把 AI 和 Space、Connectivity 并列为三大业务分部,并把 AI 称为未来垂直整合的基础平台。在 SpaceX 自己测算的 28.5 万亿美元可量化市场中,AI 占 26.5 万亿美元,火箭和卫星连接业务加起来只有约 2 万亿美元。马斯克预计 AI 收入可能在 2026 年 9 月超过 SpaceX 其他业务收入之和,四五年后,AI 可能贡献 SpaceX 99% 的公司价值。

Grok 是这笔重投入能否获得更高回报的关键变量。AI 分部可以直接把算力卖给第三方,但只有自有模型稳定留在第一梯队,SpaceX 才有机会把同一套基础设施向上延伸到 API、订阅和 Agent 等更高附加值的业务。

如果 Grok 保持第一梯队,SpaceX 可以同时赚模型、应用和算力的钱,还能用自己的模型给 Colossus 乃至未来的轨道算力制造需求。如果 Grok 掉队,Colossus 照样可以把 GPU 租给 Anthropic 和 Google,但 SpaceX 会从全栈 AI 公司退回成重资产算力房东,负责建机房、买芯片和交电费。

而且 236 亿美元资本开支,如果最后只训练出一个二流模型,这个故事恐怕马斯克自己都不好意思讲。

03. 从比 Token 单价,到比 " 一次交付 "

过去几个月,大模型竞争堪称惨烈。

Anthropic 依靠 Claude Code 和 Fable 5 在编程场景建立优势,OpenAI 随后用 Codex 和新模型追赶,Grok 又在一个多月内连续更新两代。

榜单前排的保鲜期,已经从几个月缩短到几周。当头部模型之间的能力差距只剩几个百分点,另一个数字就会变得格外显眼——价格。

来自中国的模型,把这种压力进一步往前推。

7 月,月之暗面发布拥有 2.8 万亿参数和 100 万 Token 上下文的 Kimi K3。它的价格虽不算便宜,但开放权重本身就在削弱头部模型厂商对推理价格的控制力。

DeepSeek 走得更彻底。截至 8 月 13 日,DeepSeek V4 Flash 每百万输入和输出 Token 的价格分别只有 0.14 美元和 0.28 美元。在 DeepSeek 公布的结果中,它的推理能力已经接近 V4 Pro,简单 Agent 任务也能做到相近水平。当天,DeepSeek 虽然宣布从北京时间 8 月 17 日 0 点起改用峰谷定价,但即便按高峰价计算,仍明显低于 Grok 4.6 的 2 美元和 6 美元。

OpenAI 也开始重新算这笔账。

7 月 30 日,在 GPT-5.6 发布仅三周后,OpenAI 将 Luna 价格下调 80%,Terra 下调 20%。目前,Luna 每百万输入和输出 Token 分别为 0.2 美元和 1.2 美元,Terra 则为 2 美元和 12 美元。

OpenAI 的打法非常清晰:Sol 处理最复杂的判断和规划,Terra 承担日常工作,Luna 执行大量边界清晰、重复度高的任务。它争夺的是通过模型分工,把整条工作流的平均成本压下来。

图源 / Artificial Analysis

大模型竞争由此进入了一套更复杂的计分规则。

模型能力决定能不能上桌,长任务可靠性决定客户敢不敢把活交给你,单位任务成本决定客户能够用多少次。再往后,还要比较算力、分发、企业客户,以及持续烧钱的耐力。

Token 单价只是其中最容易看到的数字。

一个模型即使每百万 Token 便宜一半,如果执行任务需要更多步骤、更频繁重试,或者总是在最后 20% 失败,节省下来的推理费用很快就会被返工和人工审核吃掉。客户真正购买的,其实是一次成功交付。

这也是为什么 Grok 4.6 眼下最值得关注的指标,并不只是 2 美元输入、6 美元输出。如果它能以更低成本完成同样的任务,它就是更便宜的模型;但如果它在 TerminalBench 这类长任务里更容易失败,那么 " 便宜 " 就可能只是停留在价目表上。

拿这把尺子再看硅谷,各家手里的牌并不相同。

Anthropic 握着 Claude Code、长任务能力和企业客户信任,但它必须不断证明,这些优势值得更高的价格。OpenAI 拥有 ChatGPT、Codex 和覆盖不同价位的模型矩阵,可以在能力、速度和价格之间灵活调兵。Google 手里则有 TPU、Google Cloud、搜索、Workspace 和 Android,可能是所有玩家中基础设施和分发最完整的一家。Meta 走的是另一条路,通过开放权重和社交平台分发,不断压低通用模型能力的稀缺性,只是如何把这种影响力真正转化成收入,始终是另一道题。

SpaceXAI 的特殊之处在于,它没有哪一张牌绝对领先,但几张牌已经开始互相喂养。Colossus 提供算力,X 提供实时信息、用户和分发,Cursor 提供真实编程任务、工具调用轨迹和开发者反馈,Grok 再把这些资源转化成 API、订阅和 Agent 产品。模型进入 X 和 Cursor 之后产生的新反馈,又可以继续回到下一轮后训练。

随着 Grok 重新挤进第一牌桌,黄仁勋 2025 年的一段评价也被重新翻了出来。他当时认为,马斯克同时押注基础模型、自动驾驶和人形机器人,进入了 AI 最重要的三个方向,并因为掌握大量真实世界数据而处在 " 绝佳位置 "。这个判断现在更容易理解了。

但拥有版图,不等于已经形成闭环。

特斯拉仍然是一家独立公司。自动驾驶、机器人、X 和 Grok 之间究竟能够共享多少数据、模型和客户,还受到组织边界、隐私与监管的约束。SpaceXAI 也没有 Google Cloud、Microsoft Azure 或者企业办公软件那样成熟的销售和交付渠道。

更现实的问题是,Grok 在 TerminalBench 等长链条 Agent 测试中仍然落后。企业客户对于安全、稳定性、透明度以及品牌风险的顾虑,也没有因为一次榜单上升就自动消失。

从 " 最有性价比的第一梯队模型 " 到 " 最大的商业赢家 " 之间,仍然隔着可靠性、企业信任、渠道和真实采用率。

就像马斯克想让 Grok 拍完《奥德赛》一样,生成短片已经不是最难的事。真正难的是,别在返乡路上翻船。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

奥德赛 马斯克 荷马 诺兰 三分钟
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论