记者 | 叶晓丹
编辑 | 梁露月 黄胜 易启江 校对 | 张锦河
7 月 31 日,DeepSeek 官宣 DeepSeek-V4-Flash 正式版 API(接口)开启公测。DeepSeek 表示,DeepSeek-V4-Flash 正式版大幅升级其代理能力,正式版的基准测试得分已远超 V4-pro 预览版。
基准测试数据显示,在 Agent 智能体终极测试中,V4-Flash 正式版的得分为 25.2 分,接近 Opus-4.8 25.7 分的得分,远高于 V4-pro 预览版 15.8 的得分。
消息一出,吸引了全球 AI 开发者的关注,V4-Flash 正式版的价格、公测体验、Agent(智能体)能力成为不少科技爱好者的关注点。
过去一年,DeepSeek 凭借极低的 API 价格和优秀的模型能力,在全球开发者市场迅速建立影响力。DeepSeek V4-Flash 正式版在大模型市场,对 AI 开发者而言,是否仍有吸引力?
实测:Agent 能力不错
交付结果达到可用水平
在关注到 DeepSeek-V4-Flash 正式版 API 开启公测后,AI 深度开发者张泽第一时间接入了 V4-Flash 正式版 API ,在此之前,他深度使用 codex 和 hermes 等国内外各类 AI 产品。
V4-Flash 正式版上线之后,张泽将其接入 Hermes 使用。" 最直观的感受就是任务处理速度很快,在给到相同任务和提示词的情况下,V4-Flash 正式版 +Hermes 大概用了 40 秒完成,而 GPT-5.6 Sol+Codex 用了 1 分 47 秒。当然也要承认 Codex 的输出内容质量确实更高一些,不过 V4-Flash 正式版的交付也达到了可用水平,在及格线之上。"
8 月 1 日,AI 开发者孙涛也向《每日经济新闻》记者反馈其体验后的感受," 在国内模型里,它比 GLM 5.2 会好一些,但是比 GPT 5.6 其实还差一些 "。
对于 V4-Flash 正式版的 Agent 能力提升,孙涛反馈 " 现在主力用的工具一个是 Codex,一个是 Pi Agent。我把 DeepSeek V4-Flash 接入 Pi Agent,目前的使用体验挺好的,V4-Flash 不像 GPT 那样是多模态,所以它的主要用途可能是在偏推理、代码和长文档这一块。"
而在 Agent 能力体验上,张泽认为,V4-Flash 正式版在接入 Hermes 的实际使用中选择和调用 skill 的准确度总体上还不错,可以根据工具返回结果调整后续步骤,从实际体验来说,这套组合已经能够比较顺畅满足个人需求。
51 万 Tokens 消耗 0.53 元
V4-Flash 正式版性价比很高
不过对 AI 开发者以及个人爱好者而言,价格依然是他们的敏感区间。
6 月 29 日,每经记者收到 DeepSeek 在今年 6 月底发给 API 用户的邮件,DeepSeek 在邮件中提到了 V4 正式版在功能和性能上会有更多优化和提升,更重要的是,API 定价策略首次引入了峰谷定价机制。
根据最新的定价机制,DeepSeek-V4-Pro 的价格相较于 4 月份的预览版出现大幅下降。其中百万 tokens 输入(缓存命中)的价格下降幅度最为明显,从 4 月份的 1 元,下降为正式版平时价格 0.025 元,高峰时段 0.05 元。
整体来看,对于 API 用户而言,DeepSeek-V4 正式版发布,token(词元)成本有了大幅降低。但对 DeepSeek 而言,这次的定价调整,也存在不降反升的情况。
譬如 DeepSeek-V4-Flash 正式版,百万 tokens 输入(缓存未命中)和百万 tokens 输出在高峰时段的成本反而比 4 月的预览版定价翻倍,分别是 2 元和 4 元。
根据最新披露的百万 tokens 价格来看,DeepSeek 的价格体系和此前邮件透露的保持一致。不过目前峰谷定价机制具体的执行时间,还未正式通知。
那么,对比国外大模型,V4-Flash 正式版在成本上有多大的优势?
张泽给了每经记者一组非常直观且鲜明的对比。
按照当下的官方 API 定价,GPT-5.6 Sol 每百万 tokens 输入、缓存输入和输出价格分别是 5 美元、0.5 美元和 30 美元;而 V4-Flash 正式版分别是 1 元、0.02 元和 2 元人民币,成本差距差不多在数十倍到上百倍。" 在我平时只是利用 AI 搜集汇总信息、总结一些文件和简单编程的情况下,V4-Flash 正式版非常香,性价比很高,从账单上看,V4-Flash 正式版接入 Hermes 执行了一次本地文件阅读和全网的信息检索汇总任务用量大概是 51 万 tokens,消耗 0.53 元。"

DeepSeek Harness 即将公布
过去一年,DeepSeek 凭借极低的 API 价格和优秀的模型能力,在全球开发者市场迅速建立影响力。越来越多企业开始接入 DeepSeek API,大量海外开发者迁移至其平台,其调用量快速增长。
7 月 28 日,OpenRouter 最新数据显示,中国 AI 大模型周调用量领跑全球。依次为小米 MiMo-V2.5、DeepSeek V4-Flash、腾讯 HY3、智谱 GLM-5.2 以及 DeepSeek V4Pro。DeepSeek 的 2 个模型都挤进了前五名的席位。
OpenRouter 官方此前披露,中国模型全球市场份额于 6 月初整体超越美国模型。截至 7 月 26 日的近 28 天统计数据显示,中国模型所占份额约为 63.5%,美国模型份额为 35.5%,双方差距进一步拉大。
而当 AI 的趋势向 Agent 转向时,Harness 的重要性日益提升。Harness 是包裹在 AI 模型外的一整套工作条件,负责给模型准备上下文、工具、任务状态、反馈和边界,简单说就是让 AI 智能体从 " 能聊天 " 变成 " 能干活 " 的基础设施。
DeepSeek 在上半年加大 Harness 布局。在此前释放的招聘信息中,多次提到了 Harness 领域的人才招聘。6 月 21 日,崔添翼在社交媒体发文表示,作为新成立的部门,DeepSeek Harness 组的目标远大、工作繁重,仍然非常缺人。
时隔一个月后,DeepSeek-V4-Flash 首次披露了 DeepSeek Harness 的新进展:DeepSeek Harness 即将公布。
中信证券认为,Harness 核心价值:一是解决长程任务痛点,将模型能力转化为稳定、低成本的端到端交付;二是连接模型与泛办公场景,拓展万亿市场并沉淀稀缺数据反哺迭代。AI 竞争正由模型转向任务交付,成熟 Harness 厂商将占先机。
封面图片来源:每经媒资库
|每日经济新闻 nbdnews 原创文章|
未经许可禁止转载、摘编、复制及镜像等使用
每日经济新闻


登录后才可以发布评论哦
打开小程序可以发布评论哦