腾讯科技 2小时前
DeepSeek,发动“临时价格战”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

8 月 12 日晚,DeepSeek 更新官方 API 文档,旗舰模型 DeepSeek V4 Pro 0813 正式版(以下统称为 V4 Pro)悄然上线。这是继 7 月 31 日 V4 Flash 0731 转正之后,DeepSeekV4 这一代产品补上的最后一块拼图

能力方面,V4 Pro 的 Agent 能力几乎全面提升,知名机构 SemiAnalysis 表示,DeepSeek V4 Pro 和 Flash 在 Agent 相关测试中,都甩开了参数更大的英伟达Nemotron 3 Ultra模型

根据 DeepSeek 释放的基准测试数据,V4 Pro 在终端操作、代码工程等基准测试中 " 猛追 "Opus 4.8、Fable 5 这种海外前沿模型,并在部分基准测试中领先。

价格上,V4 Pro 定价延续了 DeepSeek 一贯的 " 地板价 " 策略。根据官方页面提供的信息,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元。以输出为例,V4 Pro 6 元的输出价格仅为Opus 5 的三十分之一、Fable5 的六十分之一

不过需要注意,DeepSeek 也在官方页面上预告涨价,且涨幅较大。从这个角度来看,平价的 V4 Pro 可以看作是 DeepSeek 在新模型上线初期引流的一场 " 临时价格战 "。

01

1M 上下文、双 API 兼容、全功能开放

根据 DeepSeek 官方文档,V4 Pro 正式版模型版本号为DeepSeek V4 Pro 0813,开发者可通过 deepseek V4 pro 直接调用。与 Flash 版一致,V4 Pro 提供OpenAI 格式Anthropic 格式两套接口。

核心规格方面,V4 Pro 支持100 万 tokens 上下文窗口最大 38.4 万 tokens 输出,可以一次性读入大型代码仓库、企业知识库或长篇文档,并支撑长时间、多步骤的 Agent 任务。

模型默认开启思考模式,同时支持切换为非思考模式,开发者可在响应速度与推理深度之间自主选择。

V4 Pro 与 Flash 版完全一致:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写(Beta)全部支持;FIM 补全(Beta)则在非思考模式下可用。这意味着DeepSeek 在接口层面已经完整对齐了当前主流的 Agent 开发工具链

价格方面,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元;Flash 版对应价格为 1 元、2 元与 0.02 元,两者价差恰好三倍,形成 " 高频轻量任务走 Flash、复杂推理任务走 Pro" 的清晰产品分层。

另外,在并发限制方面,Pro 为 500,Flash 为 2500,进一步印证了两者的定位差异。

02

Agent 能力代际跃升

根据 DeepSeek 官方释放的信息,V4 Pro 0813 在终端操作、代码工程、工具调用、安全攻防等维度的基准测试中 " 猛追 "Fable 5 这种海外前沿模型,并在部分基准测试中领先。

其中,考察模型在真实终端环境中执行命令、解决系统问题的能力的 Terminal Bench 2.1 中得分 87.9;面向 AI 安全攻防场景的 Cybergym 中得分 83.3;聚焦软件工程与数据科学全栈任务的 DeepSWE 与 DSBench 中分别为 62.7、71.1(DSBench-FullStack)、67.2(DSBench-Hard);在考察知识推理深度的 HLE(Humanity ’ s Last Exam)上,无工具 / 带工具成绩分别为 42.7/60.0;在衡量自动化流程的完成质量的 AutomationBench 中得分 31.8。

相比 4 月发布的 V4-Pro 预览版,正式版基准测试释放的能力数据,可以说是代际级别的提升:DeepSWE 从 12.8 跃升至 62.7,提升近 5 倍;Cybergym 从 52.7 升至 83.3;AutomationBench 从 12.8 升至 31.8;DSBench-Hard 从 31.1 翻倍至 67.2;Terminal Bench 2.1 也从 72.1 提升至 87.9。

Agent 能力的全面暴涨,是本次正式版最核心的升级信号。

与 V4-Flash-0731(平均分约 57.4)相比,V4 Pro 在全部九项基准评测中保持领先,尤其在 DeepSWE(62.7 对 54.4)、DSBench-Hard(67.2 对 59.6)等高难度任务上拉开了明显差距。

不过也要注意,在主流基准测试中,V4 Pro 并非全面碾压:在 HLE 无工具(纯知识推理)与 NL2Repo(代码库理解)两个维度上,它与 Anthropic 旗舰仍存在实打实的差距。比较有意思的是—— HLE 加入工具调用后,V4 Pro 以 60.0 对 57.9 反超 Opus 4.8,显示其工具使用能力已能弥补纯推理的短板。

03

" 打爆英伟达 " 不靠参数

V4 Pro 正式版上线后,海外分析机构迅速给出反应。

知名半导体与 AI 分析机构 SemiAnalysis 在 X 平台发文祝贺 DeepSeek 发布 V4 Pro 0813(推文中称其为 "1.5T" 模型),并直言其在 Agent 任务上 " 大幅击败 NVIDIA 的 Nemotron 3 Ultra"(massively beats Nemotron3 Ultra on agentic tasks)。

SemiAnalysis 同时指出,定位更低的V4-Flash 0731 同样大幅领先 Nemotron 3 Ultra——而 Flash 的激活参数比后者少 4.2 倍、总参数少近 2 倍。

其引用的 Terminal Bench 2.1 数据显示:Nemotron 3 Ultra(NVFP4)得分53.9,相比 " 轻量版 " 的 Flash,也差了 29 分,Pro 的领先幅度更达到 34 分。

除了吹捧 DeepSeek 外,SemiAnalysis 还在跟帖中附上了对 Nemotron 模式的批评—— Nemotron 联盟由多个实验室和公司组成,由 NVIDIA 与 Mistral AI 共同主导一个基础模型训练,该模型将开源,并作为后续 Nemotron 4 系列模型的基础。SemiAnalysis 认为这种联盟松散不利于和 DeepSeek 这样的实验室竞争,应该在联盟内部采用 " 赛马机制 " 引导创新。

Semianalysis 贴出来的有关 V4 Pro 和 Flash 模型在 "Agent" 能力上超越英伟达 Nemotron 3 Ultra 的数据,主要反映在两个方面:一个是广度,一个是能力进化幅度。

关于覆盖的广度,前面提到过。V4 Pro 的 Agent 能力并非依赖单点突破,而是横跨九个维度全面铺开:终端操作、软件工程、数据科学全栈、安全攻防等九个维度,都在追前沿模型,甚至超过,这种全链条的能力支持,恰恰是 Agent 模型的核心竞争力。

很简单,当前的 Agent 任务,都需要长时间、多步骤地调用工具、处理异常、串联任务,任何一块短板都会导致整条任务链断裂,所以对模型的要求不是某一项激进的领先,而是要在各个维度对能力均衡的拔高。

所以在提升的幅度上,与 4 月的 Preview 版相比,V4 Pro 正式版在 Agent 维度完成了近乎重做的升级:DeepSWE 提升近 5 倍、Cybergym 提升 58%、AutomationBench 提升约 1.5 倍、DSBench-Hard 翻倍等等。

另外,Flash 0731 在 Terminal Bench 2.1 上同样拿到 82.7 分,也超过英伟达的 Nemotron 3 Ultra,说明整个 V4 系列的 Agent 能力底座已经整体抬升。

结合 SemiAnalysis 提到的参数效率(激活参数少 4.2 倍),DeepSeek 实际上还证明了一件事:Agent 能力的领先,可以不再依赖参数规模的堆砌

还有一个值得注意的信号:DeepSeek 的 Agent 团队组建。

据公开报道,该团队于今年 5 月在 DeepSeek 内部立项组建,由崔添翼(浙江大学计算机学院毕业、曾任职 Jane Street 近九年)担任负责人,首批开放研究员、研发工程师、产品经理三类岗位;崔添翼在社交平台公开表示 " 部门仍然非常缺人,每天都在面试 ",并于 8 月 2 日面向全球开发者征集 Harness 内测用户。

8 月 11 日前后,"DeepSeek Harness 团队 " 微信公众号完成注册,认证主体为北京深度求索人工智能基础技术研究有限公司,尚未发布内容——这被外界普遍解读为Harness 产品即将发布的前兆

04

价格战与 " 临时性价比 "

与前沿模型基准测试对比中,可以清楚看到:对阵 Claude Opus 4.8,V4Pro 基本打平。

双方均有数据的评测项中,V4Pro 赢下五项:Terminal Bench 2.1(87.9 对 85.0)、Cybergym(83.3 对 78.3)、DeepSWE(62.7 对 58.0)、AutomationBench(31.8 对 27.2)以及 HLE 带工具(60.0 对 57.9);Agents ’ Last Exam 双方战平(25.7 对 25.7);在 HLE 无工具(42.7 对 49.8)、NL2Repo(61.5 对 69.7)等项目中落后。

从均值的角度来看,V4 Pro 为 62.8,Opus 4.8 为 62.6 ——几乎完全持平。

对阵 Claude Fable 5,V4Pro 贴身紧逼。V4 Pro 在 Cybergym 上以 83.3 对 83.1 实现反超,AutomationBench 以 31.8 对 29.1 胜出,Terminal Bench 2.1 仅差 0.1 分(87.9 对 88.0)。平均分 62.8 对 70.5,V4Pro 达到 Anthropic 最新旗舰约九成的水平

Terminal Bench 2.1 一项的对比尤其直观:Fable5 得分 88.0、输出价 50 美元,V4Pro 得分 87.9、输出价 0.87 美元——分数相差 0.1,价格相差 57 倍。也就是说,同样跻身第一梯队的终端 Agent 能力,两者的 " 入场券 " 成本完全不在一个量级。

如果纵向对比,V4-Pro-Preview 与正式版定价完全相同,Terminal Bench 成绩却从 72.1 跃升至 87.9,这也可以变相看成加量不加

Agent 能力大幅度跃升,但业界对 DeepSeek 的共识在于——价格杀伤力。

根据公开资料,Anthropic 高端旗舰 Claude Opus 5 每百万 tokens 输入 5 美元、输出 25 美元(约合人民币 36 元 /180 元,与 Opus 4.8 定价相同);最新旗舰 Fable 5 输入 10 美元、输出 50 美元(约 72 元 /360 元)。

以此计算,V4 Pro 6 元的输出价格仅为Opus5的三十分之一、Fable5 的六十分之一

在整个前沿模型市场,DeepSeek 的价格优势仍然明显:OpenAI 旗舰 GPT-5.6 Sol 输出 30 美元(约 216 元)、均衡型的 GPT-5.6 Terra 输出 12 美元(约 86 元);定位 Coding/Agent 主力的 Claude Sonnet 5 输出 10 美元(约 72 元)。

可以说,DeepSeek 用 V4 Pro 把旗舰级 Agent 模型的价格基准线,直接拉低了一个数量级。不过,这一价格窗口可能不会持续太久。DeepSeek 已在官方页面明确标注:" 计划近期整体上调 DeepSeekAPI 服务的定价,预计涨幅较大。"

所以,DeepSeek V4 Pro 正式版 " 三十分之一、六十分之一 " 价差,本质上是发布初期的窗口期定价——对于正在选型 Agent 底座的开发者而言,当前的低价既是红利,也是倒计时。

但要知道,相比海外模型,DeepSeek 即便是涨价,在能力项毕竟前沿模型的同时,依旧有非常高的价格调控空间,或者说性价比优势。而关于涨价,Kimi 企业业务负责人黄震昕的此前的观点值得思考。他说:" 开源模型、中国大模型不该被贴上低价标签,我们做出了 SOTA 级模型 , 也能匹配合理商业定价。"

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论