每日经济新闻 11小时前
DeepSeek V4-Flash正式版来了!AI开发者实测:价格“很香”,Agent能力直追顶级模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 31 日,DeepSeek 官宣 DeepSeek-V4-Flash 正式版 API(接口)开启公测。DeepSeek 表示,DeepSeek-V4-Flash 正式版大幅升级其代理能力,正式版的基准测试得分已远超 V4-pro 预览版。

基准测试数据显示,在 Agent 智能体终极测试中,V4-Flash 正式版的得分为 25.2 分,接近 Opus-4.8 25.7 分的得分,远高于 V4-pro 预览版 15.8 的得分。

消息一出,吸引了全球 AI 开发者的关注,V4-Flash 正式版的价格、公测体验、Agent(智能体)能力成为不少科技爱好者的关注点。

过去一年,DeepSeek 凭借极低的 API 价格和优秀的模型能力,在全球开发者市场迅速建立影响力。DeepSeek V4-Flash 正式版在大模型市场,对 AI 开发者而言,是否仍有吸引力?

实测:Agent 能力不错 交付结果达到可用水平

在关注到 DeepSeek-V4-Flash 正式版 API 开启公测后,AI 深度开发者张泽第一时间接入了 V4-Flash 正式版 API ,在此之前,他深度使用 codex 和 hermes 等国内外各类 AI 产品。

V4-Flash 正式版上线之后,张泽将其接入 Hermes 使用。" 最直观的感受就是任务处理速度很快,在给到相同任务和提示词的情况下,V4-Flash 正式版 +Hermes 大概用了 40 秒完成,而 GPT-5.6 Sol+Codex 用了 1 分 47 秒。当然也要承认 Codex 的输出内容质量确实更高一些,不过 V4-Flash 正式版的交付也达到了可用水平,在及格线之上。"

8 月 1 日,AI 开发者孙涛也向《每日经济新闻》记者反馈其体验后的感受," 在国内模型里,它比 GLM 5.2 会好一些,但是比 GPT 5.6 其实还差一些 "。

对于 V4-Flash 正式版的 Agent 能力提升,孙涛反馈 " 现在主力用的工具一个是 Codex,一个是 Pi Agent。我把 DeepSeek V4-Flash 接入 Pi Agent,目前的使用体验挺好的,V4-Flash 不像 GPT 那样是多模态,所以它的主要用途可能是在偏推理、代码和长文档这一块。"

而在 Agent 能力体验上,张泽认为,V4-Flash 正式版在接入 Hermes 的实际使用中选择和调用 skill 的准确度总体上还不错,可以根据工具返回结果调整后续步骤,从实际体验来说,这套组合已经能够比较顺畅满足个人需求。

51 万 Tokens 消耗 0.53 元   V4-Flash 正式版性价比很高

不过对 AI 开发者以及个人爱好者而言,价格依然是他们的敏感区间。

6 月 29 日,每经记者收到 DeepSeek 在今年 6 月底发给 API 用户的邮件,DeepSeek 在邮件中提到了 V4 正式版在功能和性能上会有更多优化和提升,更重要的是,API 定价策略首次引入了峰谷定价机制。

根据最新的定价机制,DeepSeek-V4-Pro 的价格相较于 4 月份的预览版出现大幅下降。其中百万 tokens 输入(缓存命中)的价格下降幅度最为明显,从 4 月份的 1 元,下降为正式版平时价格 0.025 元,高峰时段 0.05 元。

图片来源:每经记者 整理

整体来看,对于 API 用户而言,DeepSeek-V4 正式版发布,token(词元)成本有了大幅降低。但对 DeepSeek 而言,这次的定价调整,也存在不降反升的情况。

譬如 DeepSeek-V4-Flash 正式版,百万 tokens 输入(缓存未命中)和百万 tokens 输出在高峰时段的成本反而比 4 月的预览版定价翻倍,分别是 2 元和 4 元。

根据最新披露的百万 tokens 价格来看,DeepSeek 的价格体系和此前邮件透露的保持一致。不过目前峰谷定价机制具体的执行时间,还未正式通知。

那么,对比国外大模型,V4-Flash 正式版在成本上有多大的优势?

张泽给了每经记者一组非常直观且鲜明的对比。

按照当下的官方 API 定价,GPT-5.6 Sol 每百万 tokens 输入、缓存输入和输出价格分别是 5 美元、0.5 美元和 30 美元;而 V4-Flash 正式版分别是 1 元、0.02 元和 2 元人民币,成本差距差不多在数十倍到上百倍。" 在我平时只是利用 AI 搜集汇总信息、总结一些文件和简单编程的情况下,V4-Flash 正式版非常香,性价比很高,从账单上看,V4-Flash 正式版接入 Hermes 执行了一次本地文件阅读和全网的信息检索汇总任务用量大概是 51 万 tokens,消耗 0.53 元。"

DeepSeek Harness 即将公布

过去一年,DeepSeek 凭借极低的 API 价格和优秀的模型能力,在全球开发者市场迅速建立影响力。越来越多企业开始接入 DeepSeek API,大量海外开发者迁移至其平台,其调用量快速增长。

7 月 28 日,OpenRouter 最新数据显示,中国 AI 大模型周调用量领跑全球。依次为小米 MiMo-V2.5、DeepSeek V4-Flash、腾讯 HY3、智谱 GLM-5.2 以及 DeepSeek V4Pro。DeepSeek 的 2 个模型都挤进了前五名的席位。

OpenRouter 官方此前披露,中国模型全球市场份额于 6 月初整体超越美国模型。截至 7 月 26 日的近 28 天统计数据显示,中国模型所占份额约为 63.5%,美国模型份额为 35.5%,双方差距进一步拉大。

而当 AI 的趋势向 Agent 转向时,Harness 的重要性日益提升。Harness 是包裹在 AI 模型外的一整套工作条件,负责给模型准备上下文、工具、任务状态、反馈和边界,简单说就是让 AI 智能体从 " 能聊天 " 变成 " 能干活 " 的基础设施。

DeepSeek 在上半年加大 Harness 布局。在此前释放的招聘信息中,多次提到了 Harness 领域的人才招聘。6 月 21 日,崔添翼在社交媒体发文表示,作为新成立的部门,DeepSeek Harness 组的目标远大、工作繁重,仍然非常缺人。

时隔一个月后,DeepSeek-V4-Flash 首次披露了 DeepSeek   Harness 的新进展:DeepSeek Harness 即将公布。

中信证券认为,Harness 核心价值:一是解决长程任务痛点,将模型能力转化为稳定、低成本的端到端交付;二是连接模型与泛办公场景,拓展万亿市场并沉淀稀缺数据反哺迭代。AI 竞争正由模型转向任务交付,成熟 Harness 厂商将占先机。

( 文中孙涛、张泽均为化名)

每日经济新闻

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai hermes 孙涛
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论