经济观察报 记者 陈月芹
DeepSeek 新模型上线不需要一则正式公告,用户们会自己发现蛛丝马迹并广而告之。2026 年 8 月 13 日凌晨,其官网 API 定价页面上,新模型 "deepseek-v4-pro" 后的版本号从预览版变成 DeepSeek-V4-Pro-0813。
两天时间里,头部大模型产品你追我赶,Grok 4.6 和总参数达到 2.4T 并开放权重的 Qwen3.8 Max 密集发布。
在评估大模型替代能力时,最核心的指标在于其能否胜任复杂、长周期的 Agent(智能体)任务。而 DeepSeek V4 Pro 的 Agent 能力已经全面逼近 Anthropic 旗下 Claude Fable 5,并在成本端降维打击。Claude Fable 5 是目前全球公认最顶级的闭源旗舰模型。
例如,在衡量终端环境中执行自主操作与问题排查能力的 Terminal Bench 2.1 基准测试中,DeepSeek V4 Pro 正式版 87.9 分,与 Claude Fable 5 的 88 分仅有极微弱的差距;在安全性和高度复杂多步骤环境交互上,DeepSeek V4 Pro 83.3 分,反超了 Claude Fable 5 的 83.1 分。
在官方 API 定价上,DeepSeek V4 Pro(现行基准)缓存未命中的输入价格为每百万 Token 3 元,输出价格为 6 元,仅为 Claude Fable 5(约 360 元)的 1/60,只有国内竞品 Kimi K3(100 元)的零头。
V4 Pro 缓存命中的输入价格则低至每百万 Token 0.025 元,在多轮对话以及写长文、写代码、生成报告等生成型任务场景,近乎 " 白菜价 "。
ChatGPT 和 Claude 等绝大多数模型的输出成本通常是输入成本的 4 倍— 5 倍,而 DeepSeek V4 Pro 的输出成本仅为输入的 2 倍。
从工作原理上看,大模型在阅读资料(输入)时能一目十行,而输出需要逐字(Token)生成,且生成下一个词时,必须重新读取前面所有词的 KV Cache(键值缓存),算力大量闲置在等待数据传输上,因此输出的成本远高于输入。
目前,大模型领域最活跃的应用场景,主要是编程开发、办公、多步骤 Agent、合成数据生成(用 AI 生成数据来训练其他 AI),而这些场景几乎都是输出消耗大户。
缩小这一价差,对开发者的利好更明显。如果输出成本是输入的 5 倍,用户开启深度思考模式明显更 " 烧钱 ",但 DeepSeek 将输出成本倍数压至 2 倍,用户用其生成复杂代码、数十页长篇报告,或让智能体在后台持续运作时,花费将大幅降低。
DeepSeek 的更新频率也在明显加速。2023 年至 2024 年,其主力模型从 Coder 到 V2、V3,迭代间隔约 5 — 7 个月;2025 年全年发布 7 个版本,主力版本迭代压缩至约 3 — 4 个月,从 R1 更新到 V3.1、V3.2,进入高频迭代期;到了 2026 年,DeepSeek 不再单次上新完整版本,先发布 V4 预览版再到 Flash 转正,间隔 98 天,随后 Pro 正式版跟进,间隔缩短至 13 天。
随着模型推理能力接近天花板,决定智能体表现的将是外部的运行框架 Harness。Harness 框架负责为模型分配权限、调取工具、管理上下文以及审批流程,是决定智能体如何读文件、失败重试和持续执行的关键。此前,在 V4 Flash 正式版的更新测试中,官方已经透露使用了即将发布的 DeepSeek Harness 框架。
(作者 陈月芹)
免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。


