出品 | 网易智能
作者 | 小小
编辑 | 王凤枝
DeepSeek 又一次引发海外开发者热议,连马斯克都在 X 上关注了它。
7 月 31 日,DeepSeek 正式开放 V4 Flash API 公测。官方公布的测试结果显示,新版本在多个智能体基准测试中大幅超过此前的 V4-Pro Preview。
真正让开发者兴奋的,并不只是一次科技圈围观,而是 DeepSeek V4 Flash 走出的路线:
在保持 2840 亿总参数规模、单 Token 激活 130 亿参数和 100 万 Token 上下文窗口的基础上,通过后训练优化提升智能体与代码能力。
更关键的是,它把这种能力压到了一个极低的价格区间。
V4 Flash 每百万未命中缓存输入 Token 仅 1 块钱,输出 Token 2 块钱;缓存命中输入成本更低至 2 分钱。 海外开发者实测中,单次任务调用成本甚至低至 0.0005 美元,与部分竞品拉开了数量级差距。
这也是 DeepSeek V4 Flash 真正引发关注的原因:
它不只是又一个 " 便宜能用 " 的模型,而是在尝试证明,接近前沿水平的智能体能力,也可以用远低于传统旗舰模型的成本运行。
官方同时明确表示,本次更新仅升级 DeepSeek-V4-Flash API,V4 Pro API 与客户端维持不变,V4 Pro 正式版即将发布。
当 OpenAI、Anthropic 等头部实验室仍在围绕更强模型和更高算力投入竞争时,DeepSeek 正在重新提出另一个问题:
前沿智能,究竟应该卖多少钱?
马斯克关注之后,
海外社区为何热议
" 马斯克需要亲自试试 V4 Flash。它就像魔法一样。"
这句话最初来自 X 上的开发者讨论。
随着这句话传播,网友发现,埃隆 · 马斯克真的关注了 DeepSeek 官方账号。这一细节迅速在海外社区引发讨论。
有网友认为,马斯克与 DeepSeek 在推动 AI 技术发展、探索科学突破方面存在一些共同点;也有人开始猜测未来可能出现合作。
当然,更多开发者选择用玩笑回应。有人调侃下一代编程模型 Composer 3.5 可能会基于 DeepSeek 构建;还有网友直接调侃 Grok:
" 我猜他要买下 DeepSeek。你说呢 Grok,你的爹要给你买个小弟弟吗?"
这些玩笑背后,是海外开发者对 V4 Flash 的真实兴趣:他们关注的不是一次社交媒体热搜,而是这个模型是否正在改变 AI 开发的成本结构。
基准压测:
官方数据与第三方验证怎么说
评估一次后训练的成效,最直接的办法就是看标准化测试集上的量化表现。
官方公布的基准测试中,V4 Flash 在模拟真实命令行环境操作的 Terminal Bench 2.1(82.7 分)、网络安全攻防 Cybergym(76.7 分)以及复杂 API 协同 Toolathlon Verified(70.3 分)等智能体场景中均表现上佳。
而在代码工程化与复杂软件重构领域(如 NL2Repo 与 DeepSWE),它同样取得了较好成绩,甚至在其内部的全栈难题测试集(DSBench-Hard)中拿下 59.6 分。
官方解释称,这套代码智能体表现是在最大努力级别与特定采样参数下跑出的。这种 " 小体积、高智商 " 的突破,直接打破了传统大模型 " 参数越庞大、智能体表现才越强 " 的固有认知。
第三方权威测评机构的交叉验证,进一步补充了该模型的表现细节。
测评机构 Artificial Analysis 在 Intelligence Index 智能指数测试中给予 V4 Flash 50 分的成绩,这一分数比上代模型提升 10 分,领先 V4 Pro 预览版 6 分,甚至追平了 Gemini 3.6 Flash,并与 GPT-5.6 Luna、GLM-5.2 等模型接近。
在运行效率与输出质量方面,Artificial Analysis 的测试表明,V4 Flash 跑完整个智能指数消耗了 2.06 亿个输出 Token,相比前代的 2.34 亿个下降 12%。
同时,该模型在 AA-Omniscience 事实准确率与抗幻觉评估中的表现提升了 12 个百分点,展现出更好的上下文理解能力。
在评估真实世界智能体任务的 GDPval-AA v2 中,V4 Flash 拿下 1559 的 Elo 评级,在开源权重模型中仅次于 Kimi K3,超越了 GLM-5.2。
而在 Arena.ai 前端代码竞技场中,DeepSeek-V4-Flash-High 拿下 1586 分,位列竞技场第七名、开源模型第三名,较前代提升 154 分。
结合其首 token 延迟(TTFT)与吞吐量(TPS)表现,凭借 98% 的缓存折扣,V4 Flash 单任务执行成本比打折后的 GPT-5.6 Luna 还低 60%。
Arena.ai 评价指出,V4 Flash 在前端代码与智能体领域重新塑造了 " 价格—质量 " 层面的帕累托前沿。
开发者工程实测:
150 倍价差下的极致性价比
随着公测展开,开发者社区涌现出大量实操压测,V4 Flash 在真实 Terminal 智能体、Canvas 前端渲染以及跨模型工作流中的表现被多角度呈现。
在最直观的极限性价比层面,科技分析师 @RoundtableSpace 在对比发布时间仅相隔七天的 Opus 5 时观察到,尽管 Opus 5 能一次完成复杂任务,而 DeepSeek 需要经过三次迭代尝试,但 Opus 输出了长达 3000 行代码,DeepSeek 用约 900 行精简代码就达到了目的,且单次尝试成本仅约 1 美分。
科技博主 @SciTechera 也援引数据进一步验证,在 Terminal-Bench 2.1 上,V4 Flash 完成单个基准任务的估计花费仅为 0.03 美元, 相比高价旗舰模型展现出了极强的成本压制。
而当脱离极端高价模型、转而对比同预算档位的竞品时,V4 Flash 依然保持了品质上的小幅领先。
在前瞻性的前端与动态交互测试中,开发者 @stevibe 将降价后的 OpenAI GPT-5.6 Luna 与 V4 Flash 放在一起对比。
在 3D 魔方旋转测试中,DeepSeek 的贴纸与旋转表现流畅,而 Luna 出现了贴纸位置错位的问题;在烟花爆破绽放效果中,Luna 出现较明显的卡顿;而在笔写 "Hello" 草书的动态渲染上,Luna 直接渲染为静态图像,DeepSeek 则完成了动态草书轨迹。
@stevibe 认为,在相同的预算档位下,DeepSeek 的综合渲染表现略胜一筹。
除了直接对抗,面对 V4 Flash 暂未原生接入视觉输入的短板,开发者们探索出了具有实操价值的 " 跨模型组合 " 工作流。
前端开发者 @hqmank 在重建 3D 地球仪表板测试中,先让 Kimi K3 读取参考图像并提取布局与颜色规范,再将结构化文本转交给 V4 Flash 进行代码生成。实测结果显示,布局与间距被较好还原,而整体输出成本远低于完全调用顶级多模态模型。
这种灵活的生态配合,最终落脚于工业级智能体开发的成本账单上。
Bold Metrics CTO 摩根 · 林顿(Morgan Linton)在 VulcanBench 测试后指出,V4 Flash 在中等努力水平(Medium Effort)下的表现极其稳定,成功击败了 Grok 4.5、Fable 和 ChatGPT。
对于需要成千上万次 API 调用的工业级智能体工作流而言,这种极低的价格让大批量自动化试错第一次具备了财务可行性。
大模型测评团队 @CommandCodeAI 在相同的游戏设计提示词测试中发现,Kimi K3 与 GLM 5.2 表现出色,单次调用花费分别为 0.0740 美元和 0.0480 美元;而 DeepSeek V4 Flash 虽在边缘细节上略显粗糙,但单次调用的实际账单仅为 0.0005 美元,便宜了整整 150 倍。
硬件与模型设计师 @bookwormengr 体验后感叹,V4 Flash 在如此小巧的体积和极低成本下展现出的知识密度简直如同 " 巫术 ", 虽然 UI 和视觉交互体验上仍可向月之暗面借鉴,但其底层智力产出已足够令人震撼。
尽管 V4 Flash 在性价比与常态代码补全上表现优异,但客观的工程压测中,它也暴露出了一定的技术边界:
首先,在极高难度的推理与算法突破场景中,Flash 模型的表现依然受限于其激活参数规模。 软件开发者 @OmedVibeCodes 在深度基准压测后指出,面对顶级模型(如 GPT-5.6 Sol、Kimi K3 等)时,V4 Flash 在处理极其复杂的长逻辑链求解上仍有明显差距。
其次,在特定测试套件的兼容性上,@OmedVibeCodes 观察到 Pi 套件在 DeepSeek 上的运行表现逊于 OpenCode,显示出不同基准下的适配差异。
此外,当前 V4 Flash 尚不支持原生的多模态视觉输入,处理图文混排任务时仍需借助外部模型进行前置解析。
因此,在真实的生产架构中,V4 Flash 更适合承担 80% 高频、常态化任务的基础引擎角色,而极端复杂的难题仍需交由规模更大的旗舰模型处理。
灰度中的 V4 Pro 提前亮相:
" 矿泉水掺顶级茅台 "
在 Flash 模型凭性价比引发关注的同时,正在小范围灰度测试的旗舰模型 V4 Pro GA 正式版也引发了讨论。
开发者 @BoxMrChen 仅用 4 行提示词,要求模型融合《我的世界》与《无人深空》的核心机制编写一款 Web 网页游戏。V4 Pro 经过深度推理,以约 0.1 美元的 Token 成本生成了包含任务树系统、物品合成逻辑与资源采集的可玩游戏。
开发者 @mirochill 在复杂 Bug 修复测试中表示,针对《鱿鱼游戏》机制的代码构建中,V4 Pro 只经历 2 次自我迭代就修复了深层逻辑缺陷,连续输出 3000 行代码,总成本仅 0.12 美元,表现足以正面抗衡 Fable 5 和 GPT-5.6 Sol。
开发者 @Waguri_Kaoruko8 补充称,新版 V4 的推理思维链(CoT)能够自动梳理出 " 编写主要场景代码…… "" 生成核心逻辑…… " 等节点,可读性有所提升。
然而,V4 Pro 展现出的生成能力,也在社区内引发了争议。
科技媒体 @TechFlowPost 报道称,有部分开发者称在调用 V4 Pro 生成复杂大厂级别代码时,发现其输出风格与某些高价旗舰模型(例如 Claude Fable 5)存在相似之处,甚至有用户称触发了疑似特定高价模型风格的安全拒绝响应,从而引发了后台是否采用了混合路由机制的猜测。
社区调侃该现象为 " 矿泉水瓶里掺茅台 "。 需要指出的是,上述安全响应细节目前多为社区反馈,尚无官方的进一步复现说明。
面对社区的种种猜想,技术专家 @TeksCreate 从架构层面给出了分析。
V4 Pro 拥有 1.6 万亿的总参数规模(推理时单 Token 激活 490 亿),采用 MoE 混合专家架构。 其核心改进在于引入了混合注意力系统,将历史压缩(CSA)、超长文本压缩(HCA)与全保真跟踪(SWA)结合,使处理 100 万上下文时的计算量降至前代的 27%,KV 缓存占用也大幅下降。
在性能上,V4Pro 在 Codeforces 跑出 3206 分,SWE-bench Verified 达 80.6%,1M 长上下文检索 MRCR 达 83.5%。 @TeksCreate 认为,这些架构创新证明 V4 Pro 本身具备独立达到该水平的技术条件。至于模型在实际部署中是否使用了混合路由,在官方明确回应之前尚无定论。
宏观市场重构:
更多人负担得起的前沿 AI 生产力
从 V4 Flash 的正式公测到 V4 Pro 正式版的灰度亮相,DeepSeek 掀起的定价风暴正在全球开发者生态与市场预期中引发连锁反应。
对比当下主流厂商的定价策略,V4 Flash 每百万输入 / 输出 Token 0.14/0.28 美元的价格,不仅让打折后的 GPT-5.6 Luna(输入 0.20 美元 / 输出 1.20 美元)感到巨大压力,更是对 Anthropic Haiku 4.5(输入 1 美元 / 输出 5 美元)形成了输入端便宜 7 倍、输出端便宜 18 倍的优势。
预测市场平台 Polymarket 的分析者 @goodworse 认为,V4 Flash 的出现将迫使前沿 AI 服务的综合使用成本进一步降低。
0xSupergemma 创始人宋骏(Jun Song)从全球经济视角分析指出,全球有相当庞大的低收入群体与初创团队无法直接承担高昂的模型订阅费。DeepSeek 极低 API 定价的意义,在于能够通过下游开发者转化为极其便宜的 SaaS 工具、应用与服务,间接让更广泛的终端用户享受技术红利,成为降低 AI 生产力门槛的重要选项之一。
《财富》杂志分析指出,DeepSeek V4 的研发与发布与华为底层芯片生态进行了紧密适配。 随着华为昇腾系列处理器软硬件协同效率的提升,未来模型推理成本还有进一步下探的空间。DeepSeek 展现出的成本优势,背后是算法架构重构与本土硬件生态适配共同作用的结果。
结语
综合官方测试集数据、权威第三方交叉验证以及一线开发者的真实反馈,DeepSeek V4 Flash 展现出的核心价值,并不在于要在每一个实验室单项榜单上都拿下第一,而在于它以一种务实的方式,重构了智能体与代码开发中的成本账单。
在现代智能体软件工程中,一个看似简单的自然语言指令,往往需要拆解为意图理解、环境感知、文件检索、工具调用以及多次代码生成与自我修正,调用的乘数效应会瞬间放大 Token 消耗。
V4 Flash 在中等努力水平下的稳定性、对 Codex 接口的无缝集成以及高额缓存折扣,为开发者提供了一个能够支撑大规模日常调用的基础选项。
当越来越多的企业财务官与开发者开始精细化计算 API 账单时,答案已经很明确:前沿智能的价格,正在被重新定义。
——社群推荐——
与前沿大脑同步在线,让思维时刻领先。
欢迎扫描下方二维码,加入你的科技同行圈。
▲欢迎加入粉丝群▲
—— END ——
排版 | 李雨希 审核 | 北辰


登录后才可以发布评论哦
打开小程序可以发布评论哦