梁文锋对决马斯克的三场关键战役。
一夜之间,梁文锋与马斯克正面 " 撞车 "。
8 月 12 日夜间,DeepSeek V4-Pro 先是在 API 文档中悄悄上线,随后官网横幅和公告又 " 诡异 " 消失;直到次日 19 时 19 分,公众号才正式官宣。
从 4 月 24 日预览版亮相,到本次正式版本落地,历时 111 天。原本计划 7 月中旬发布,几经延期后终于在 8 月中旬登场。几乎同一时刻,马斯克的 SpaceXAI 推出 Grok 4.6。
两款 SOTA 模型同台竞争,并不罕见。总体来看,DeepSeek V4-Pro 在 AI 安全(Cybergym)和工作流自动化(AutomationBench)等特定领域更具优势;而 Grok 4.6 则在综合智能指数(Artificial Analysis)和软件工程(DeepSWE)等测试中表现更佳,并在成本效率上优势显著。
13 日上午,当部分开发者质疑 DeepSeek V4-Pro 能力时,DeepSeeK 扔出了一颗深水炸弹:Harness。就在前一天,马斯克同样发布了智能体 Grok Bot。
智能体,成了这轮对决最激烈的部分。DeepSeek Harness 上线半小时 GitHub 星数即破万,12 小时破 5 万,以 " 一切皆插件 " 理念构建 Agent 生态;而 Grok Bot 则走云端全能助手路线,主打 7x24 小时 " 跟班学习 "。
但对决远未结束。模型正面交锋的同时,DeepSeek 自建数据中心计划已经启动,试图从底层补齐算力短板。另一边,马斯克则放出豪言,称五年之内 SpaceXAI 的算力能力,将超过其他所有公司的算力总和。
一边是埋头建设自有算力底座、靠工程效率追赶的 DeepSeek,一边是手握超算集群、野心拉满的 xAI。基础模型比拼硬实力,智能体角逐下一代应用入口,算力则决定长期发展的上限。模型、智能体、算力三大战场环环相扣,梁文锋与马斯克的三轮对决就此展开。
基础模型:马斯克更便宜,更好
Anthropic 推出的 Claude Fable 5 是当下 AI 行业公认的复杂智能体能力天花板:凭借顶尖的长链路任务处理、超大工程代码重构等能力,长期霸占 Agent 赛道跑分榜首。
就在 DeepSeek V4 ‑ Pro 与 Grok 4.6 同步亮相的当晚,两款模型直接站到了 Fable 5 的眼皮底下,从不同方向发起冲击。
跑分层面,官方公布的基准测试直接对标当前业界公认的两座山头,DeepSeek V4 ‑ Pro 在多项指标上与 Fable 5 整体旗鼓相当。
Grok 4.6 则重点针对长程智能体、复杂编程和知识工作。SpaceXAI 公布的数据是:在真实世界专业任务评测 GDPVal-AA v2 中拿到 1753 Elo,高于 Claude Fable 5 Max 的 1741 分。Artificial Analysis Intelligence Index 达到 61。
有用户体验后,发现 DeepSeek 在速度上依然保持惯有的优势,碾压 Grok 4.6。在相同的提示词下,仅用 16 分钟就完成了任务,用时为 Grok 的一半,视觉效果也超出预期。
但也有一位用户实测后发现:DeepSeek V4-pro 用了更长时间,消耗了更多代币,但表现却没有很好。最明显的是,靠近视线处,水面波纹应该更大,而 DeepSeek 几乎没有波纹。并且,帆船随着波浪前行的轨迹也不自然。
Artifical Analysis Intelligence Index 的测评结果显示,V4-Pro 为 53 分,仅比 Flash 版本提高了 1 分。这让用户不满。
性能之外,二者最大的区别体现在定价层面。
DeepSeek V4 ‑ Pro 当前定价为输入 0.43 美元 / 百万 Tokens,输出 0.87 美元 / 百万 Tokens,缓存命中输入只有 0.0036 美元。
以 Fable5 的价格作为对比,DeepSeek V4 ‑ Pro 普通输入比 Fable5 便宜 23 倍,输出便宜 57 倍。
然后是 Grok4.6,输入 2 美元 / 百万 Tokens,比 Fable 5 便宜 5 倍;输出 6 美元 / 百万 Tokens,比 Fable 5 便宜 8 倍多。
直接将 DeepSeek V4 ‑ Pro 与 Grok4.6 做横向对比,价差同样十分悬殊。输入侧,Grok4.6 的单价约为 DeepSeek V4 ‑ Pro 的 4.7 倍;输出侧,Grok4.6 的价格达到 DeepSeek V4 ‑ Pro 的近 7 倍。

不过,昨天发布正式版本后,DeepSeek 宣布随着 V4 全系列模型正式版上线,8 月 17 日起将对 API 价格进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。
调整后,以高峰时段对比,DeepSeek-V4 Pro 缓存命中输入涨至 12 倍,未命中输入涨至 3 倍,输出涨至 4.5 倍。涨价后,对比 Gork 4.6,DeepSeek V4-pro 在高峰期的性价比优势已经不明显。

不过,即便涨价前,DeepSeek V4 Pro 的成本优势已经不那么明显。开发平台 Composio 对两个模型进行了 30 项高难度智能体任务的对比测评,结果表明 Grok 在通过率、速度和成本方面均优于 DeepSeek。
智能体之争,完全不同的路线
就在正式发布 DeepSeek V4-Pro 的同时,DeepSeek 面向全球开发者开放 DeepSeek Harness 开发者预览版(v0.1)。
这并不意外。公告中明确写道,正式版 V4-Pro 特意增强了 Agent 能力,而 Harness 正是承载这一能力的首个产品。
DeepSeek Harness 是 DeepSeek 于今年 5 月组建的代码智能体团队,核心目标是开发对标 Anthropic Claude Code 的桌面端智能体编程产品,是目前 DeepSeek 关注度最高的团队。
Harness 团队负责人崔添翼在 "X" 平台上表示,现在 0.1 版本是一个面向 Harness 开发者的预览版本,还很不完善,恳请大家多提宝贵意见。

不少内测用户称,Harness 已经内置了多种子智能体和工作流能力,能够自主完成需求理解、代码生成、调试修复等多步骤任务。
它的核心作用,是为同一个大模型,动态搭配不同的 " 工具包 " 和 " 工作模式 ",来应对各种任务。用户根据任务的复杂度,在会话开始时为模型选择不同的 "Agent 预设 ",像是给同一个专家,配不同的工具,以完成不同难度的任务。一些开发者评论,Harness 令人惊艳。
几乎同一时间,马斯克旗下的 SpaceXAI 也出手了。8 月 12 日,推出人工智能软件 "Grok Bot",声称这是一支全天候在线的智能助手团队,可以接受并完成用户分配给它们的实际工作任务。
SpaceXAI 表示,Grok Bot 最初只是一个内部原型,没想到它会在公司内部迅速普及,团队都创建了 Bot 来处理销售外呼、市场营销活动、办公室日常运营、漏洞修复等。
目前,Grok Bot 处于测试阶段,即日起面向 Windows、iOS 等平台上的 SuperGrok Heavy、Cursor Ultra 和 Cursor Teams 订阅用户开放。
DeepSeek Harness 和 Grok Bot 走了两条完全不同的路线,前者面向开发者,核心场景是编程,而后者面向想要用 AI 提效的普通人。实测发现,用 DeepSeek Harness 重构一个网页仅需要消耗 3 元,但在长程任务中,响应速度偏慢,需多轮交互,更擅长长文本、多步骤任务的资源优化。
而 Grok Bot 响应速度快,但 token 成本高于 Harness(输入 $2/ 百万,输出 $6/ 百万),长文本场景下总成本可能更高。
对比 DeepSeek Harness,SpaceXAI 的牌远不止 Grok Bot 一张。今年 6 月,SpaceX 以 600 亿美元的价格收购了 AI 编程初创公司 Cursor。
相比之下,DeepSeek 的节奏显得更克制,集中力量自研,以工程效率追赶。一边用资本杠杆压缩时间,一边用工程迭代换取空间。
双方不约而同瞄准智能体时,谁能率先把模型能力嵌进真实的工作场景,谁就握住了下一代应用的入口。
算力之争:工程能力 VS 现金储备
算力是决定谁能跑得更远的底层燃料,也是这场对决的终极比拼。
几乎所有的模型公司都遇到了算力不足的情况。月之暗面旗下的 Kimi K3 因为卓越的性能一举刷新榜单,但却因为用户请求远超预估,算力逼近集群承载极限,上线 48 小时便暂停订阅。
DeepSeek 今年频繁因为服务中断登上热搜,背后就是激增的用户规模和算力扩容的严重错位。
梁文锋曾表示,目前 DeepSeek 拥有约两万张 H100 等效算力,落后美国 12 到 18 个月,国产算力卡可用数量仅一万六千张,难以支撑超大参数模型的完整训练迭代。
算力的限制也让 DeepSeek 在技术路线选择上更为现实,梁文锋选择极致工程优化,DeepSeek V3 训练成本不到 560 万美元。
但这并不能解决用户的需求。DeepSeek 已经完成了 A 轮 510 亿融资,新一轮融资也在推进,梁文锋曾在投资者会上直言,融资要 " 尽快换成 GPU",如果市场允许,2026 年采购 200 亿元算力也可以接受。
相比之下,世界首富马斯克在算力储备上要富裕得多。Grok4.5 由数万块 NVIDIA GB300 GPU 训练而成,其背后的 Colossus 超算集群总算力规模 2024 年约 20 万张 H100 GPU,是 DeepSeek H100 等效算力(约 2 万张)的 10 倍。
Colossus 首批 10 万块 GPU 超算集群从启动到上线仅用 122 天,展现了马斯克在算力建设上的 " 钞能力 " 和执行力。当 DeepSeek 为 200 亿元的采购计划筹措资金时,XAI 已经落地投产。
在 Gork 4.6 发布前两周,马斯克在 "X" 平台上关注了 DeepSeek 的官方账号。连他旗下的 Grok 都承认,这相当于把 DeepSeek 列入了 " 必须紧盯的对手名单 "。而在此之前,马斯克甚至不相信 DeepSeek R1 只用了那么少的算力,反复说 " 它至少有 5 万张 H100"。
这场贴身肉搏之战还在继续。Grok 4.6 只是前菜,马斯克明确表示 Grok 4.7 将在数周后推出,参数规模预计达到 2.1 万亿,目标 " 超越所有目前的模型 "。而梁文锋也一直在追逐 AGI(通用人工智能)的路上。
从模型,到智能体,再到算力,马斯克和梁文锋的对决,还未分出胜负。


登录后才可以发布评论哦
打开小程序可以发布评论哦