科技每日推送 4小时前
AI斩杀线更新!DeepSeek V4 Pro正式版发布,马斯克成最大受害者
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者 | 赵芷姗

编辑 | 周伟鹏

8 月 12 日晚,DeepSeek 突然发布 V4 Pro 正式版,目前官网已更新部分信息。

它拥有 100 万 Token 上下文长度,最大 384K 输出长度,支持思考模式和非思考模式。

根据最新的跑分图,其多项能力逼近全球最强模型 Fable   5,甚至有几项超过了它。

这下子,梁子变梁神了。

几乎同一时间,马斯克旗下 Grok 4.6 也正式发布,新模型很强,性价比也遥遥领先它的美国同行。

可惜碰到了梁叔叔,DeepSeek   V4   Pro 在性能稍强的情况下,输出价格只有 Grok 4.6 七分之一左右。

刚发布就要掉入斩杀区?

智能体能力突出

多个指标超过 Fable 5

4 月 DeepSeek V4 Pro 预览版问世时,它的智能体相关评测成绩还并不算亮眼,不少硬核任务跑分落后海外头部模型。

而这次 0813 正式版,完成了一次堪称脱胎换骨的迭代,尤其在智能体实操任务上实现大幅跨越。

在终端操作测试上,它拿到 87.9 分,高于 Opus 4.8 的 85 分,距离 Fable 5 只差 0.1 分。

这项测试考验模型操控 Shell 命令、运维沙盒环境、批量处理文件的真实动手能力,是智能体最硬核的指标之一。

在软件工程任务测评中,V4 Pro 正式版拿到 62.7 分,大幅甩开旧预览版的 12.8 分,高于 Opus 4.8 的 58 分。

这代表模型不再只擅长简单的代码补全,面对大型代码仓库、多文件项目重构、复杂 Issue 排错,已经具备成熟的处理能力。

而在网络安全智能体测试上,它更是一举超过 Fable 5,显示出面对漏洞复现、安全攻防类任务的独特优势。

当然,它并非全维度通吃,在高难度推理、超高难度综合任务上,对比 Opus 4.8、Fable 5 依旧存在差距。

价格上 V4 Pro 延续了 DeepSeek 超高性价比优势,百万 Tokens 输入只要 0.435 美元(国内 3 元),输出也只要 0.87 美元(国内 6 元)。

相比大洋彼岸的闭源模型,便宜得有点夸张。

Harness 有望今日发布

DeepSeek 搭建起完整智能体方案

就在 DeepSeek V4 Pro 发布之时,有社区爆料 DeepSeek Harness 也将在今天开启公测。

如果说 V4 Pro 是智能体的大脑,那 Harness 就是四肢和神经系统,两者合在一起才是完整可用的智能体。

大模型本身只会输出文本,真正要让 AI 去写代码、改文件、跑测试、调试报错、反复迭代直到任务完成,光有模型远远不够,中间需要一整套 " 手脚 " 和 " 调度系统 ",这就是 Harness。

今年 5 月,DeepSeek Harness 在内部正式立项,8 月 2 日开始内测,这两天 Harness 还注册了官方微信公众号。

一切的迹象都说明它快来了。

过去,开发者拿到大模型 API,想要做可用的代码智能体,所有执行逻辑、工具循环全部需要自己从零搭建。

而随着 Harness 开启公测,DeepSeek 可以直接交付一套完整闭环方案:模型负责思考推理,Harness 负责落地执行。

这意味着 DeepSeek 的竞争从单纯模型跑分升级到完整智能体栈的对抗。

Grok 4.6 很强但有短板

性价比还得看 DeepSeek

同一时间发布的 Grok 4.6,同样来势汹汹。

智能综合指数拿到 61 分,追平 GPT   5.6 Sol Max;Cursor 代码测评达到 69.9%,在单文件代码改写、日常代码补全场景表现亮眼,现实复杂任务测试甚至跑出 15.8% 的高分,通用综合推理是它的长板。

从第三方交叉测评来看,Grok   4.6 的短板集中在 Shell 终端长链条操作、网络安全智能体,这恰好是 DeepSeek V4 Pro 最强的领域。

而 V4 Pro 几乎无短板。终端操作、代码工程、安全攻防、高难推理,没有任何一项掉出全球第一梯队。

Grok   4.6 虽然学习 GPT 也开始打价格战,不仅比 Opus 5 和 5.6 Sol 便宜,甚至比 Sonnet 5 还便宜,在海外模型中很有性价比。

但它偏偏遇上了 DeepSeek。

结语

这一次 Grok   4.6 与 DeepSeek V4 Pro 近乎同期发布,是全球 AI 竞争一个标志性的节点。

大模型比拼不再只看纸面综合分数,场景落地、配套工具链、成本、本地化可用性,正在变得越来越重要。

Grok   4.6 证明海外厂商依旧在通用推理上保持强大实力,而 DeepSeek V4 Pro   0813 加上 Harness,则证明国内团队已经有能力在智能体这个下一代 AI 核心赛道,拿出可以和海外顶尖产品掰手腕的完整方案。

END •

欢迎点击科技每日推送视频号,看最新视频 ~

Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

评论
大家都在看