投资界 3小时前
DeepSeek开始追求极致的「智能密度」
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

DeepSeek 给新 Flash 出了一道题:能不能把自己的 Pro 替下来?

昨天,V4.1 Flash 中间版本开启内测。新的模型结构、原生多模态、更快的速度,都是公告里的卖点。但在配套反馈问卷中,DeepSeek 直接问用户:" 你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么 "。

好嘛,我打我自己。DeepSeek 正在测试,把 flash 到底从效果上能不能超过 flash,能不能交给更便宜、更适合大量调用的型号。

Pro 与 Flash 之间,本来就有实实在在的价格差。目前高峰时段每百万输出 token,Flash 收 9 元,Pro 收 27 元。

但是就在刚才,DeepSeek 又在开放平台宣布,9 月 10 日中午起下调 Flash 系列价格:空闲时段每百万 token 的缓存命中输入降至 0.02 元,未命中输入降至 1 元,输出降至 4 元;高峰价格仍为空闲时段的两倍。三项降幅分别为 60%、约 33% 和约 11%。

新 Flash 还在测试能否接替 Pro,Flash 系列的使用门槛已经先往下降了。

开发者可以为了更好的结果,偶尔付三倍单价。但是真的到日常使用,那些可用可不用的环节,flash 的必要性就凸显出来了。

DeepSeek 想让新版本同时具备两者的长处:Flash 快,Pro 强,Flash V4.1 又快又强。

一年多前,R1 的冲击让人们愿意给 AI 更多时间,看看它究竟能想出什么。如今,DeepSeek 要回答的是:已经获得的推理能力,怎样才能被更频繁地使用?

01、" 智能密度 " 开始重要

R1 在 2025 年年初走红时,吸引力也来自这种能力终于变得容易获得。DeepSeek 同时开放模型权重,将 R1 放进官网、App 和 API,普通用户打开 " 深度思考 " 就能使用,开发者还可以用它的输出蒸馏自己的模型。

高水平推理不再只是少数实验室能够展示的东西。它进入聊天窗口,也进入了其他公司的产品开发。

2025 年 5 月,DeepSeek 更新 R1 时,曾把 " 思考更深 " 当成最重要的进步。

在 AIME 2025 测试中,旧版 R1 平均每题使用约 1.2 万个 token,新版增加到 2.3 万个;准确率从 70% 提高至 87.5%。这次更新让 R1 答得更准,平均每题的推理消耗也接近翻倍。

这套办法有它的道理。困难题目没有现成答案,模型需要尝试方法、检查中间步骤,发现错误之后重新计算。只要结果值得,额外的等待就能够被接受。

但在 2025 年 12 月发布的 V3.2 报告里,DeepSeek 对自己提出了另一项要求:提高推理链的 "intelligence density",智能密度。原因也很明确,为了达到 Gemini 3.0 Pro 等模型的输出质量,它通常需要生成更长的推理过程。

输出的等待时间已经变得很重要。差距会体现在速度上,也会体现在每次的费用里。

这个问题到了大小模型的分工中,会更加突出。V4 早期模型卡提到,Flash 在给予更多思考预算后,能够获得接近 Pro 的推理表现,但在知识和最复杂的 Agent 工作流上仍然落后。

小模型每一步计算更便宜,却可能要走更多步,才能得到大模型的结果。开发者看到的单价优势,最后能剩下多少,要看任务究竟怎样完成。

所以,Flash 要想替代 Pro,需要同时改善能力和效率。更快生成冗长的推理,能减少一部分等待;更早找到有效方法,则可能连后面的计算一起省下。对经常使用 AI 的人来说,后者同样重要。

学界已经开始把用户等待的时间放进优化目标。EMNLP 2025 的一项研究指出,计算量最 优的测试时扩展方案,并不一定带来最 低延迟;研究者需要重新安排并行计算和推测解码,才能在限定时间内取得更好的结果。

DeepSeek 也已经在改造生成速度。团队在 7 月公开的 DSpark 论文中报告,在 V4-Flash 线上用户流量下,相比 MTP-1 基线、保持相同吞吐水平时,单用户生成速度提升了 60% — 85%。团队处理的是推测解码中的验证浪费,让用户更快拿到输出,同时顾及整套服务能够承接的请求量。

图 2|DSpark 官方架构图:先生成候选 token,再筛去低置信度尾部,最后由目标模型验证。来源:DSpark 论文图 1(2026 年 7 月,CC BY 4.0)

这对提供 API 的 DeepSeek 很重要。请求的更快结束,只有在没有严重牺牲总体服务能力时,才容易有效。开发者需要等待更短,DeepSeek 则需要让同一批计算资源更有效地服务用户。

" 能不能解决问题 " 和 " 用户愿意是否愿意等待解决问题 ",开始成为两道不同的考题。

它们也对应两种市场。研究人员可以为一道困难问题投入大量计算,日常使用的助手则必须不断响应新的请求。前一种能力向前推进之后,厂商还得把它做成后一种服务,才有机会获得更大规模的使用。

DeepSeek 在报告中提出的智能密度,最终会在这里接受检验:原先需要昂贵模型、长时间计算才能完成的任务,能否逐渐变成普通调用。

02、Agent 要完成工作算成本

这次内测当天,LINUX DO 用户 " 觉浅 " 恰好有一个停机维护页面要做,于是把新 Flash 接进自己的编程工具。

模型的表现让他惊喜。它读到了项目规范中一条早已弃用、却没有删掉的决策记录要求,还认真列出了文档维护、代码提交和审查安排。页面生成后,他提出风格不要与原项目割裂,模型又找出了仓库已有的插画来修改。

他对模型的执行能力很满意,但觉得贵:做完这个维护页面,花了 15.5 元。

这也是 Agent 和普通聊天不同的地方。用户只交代了一项工作,模型却可能在后台运行很多轮:先读项目规范,再查文件、改代码,拿到工具返回的结果后继续检查。每轮调用都可能产生新的输入和输出费用。模型的单价低,不代表整项工作一定便宜。

要让 Agent 用起来划算,除了降低模型单价,还得检查这些调用有没有必要。有些步骤需要模型判断,有些只是按已经确定的规则读取、筛选和整理材料。如果后者也要一步步交回模型,就会增加调用和等待,中间结果还会不断占用上下文。

DeepSeek 开源的 Harness,就能参与安排这套执行流程。Deepseek 官网用 "Agent = Model + Harness" 来解释两者的关系:模型负责判断,Harness 提供工具、管理会话和运行环境,让模型的决定变成实际操作。

其中的PTC模式,允许模型一次写出一段程序,把多步工具操作串起来。比如,模型需要从一批文件里找出符合条件的内容,可以让程序批量读取、完成筛选,再把相关结果交回来。模型不必读完每份文件后都重新决定下一步,也不必接收全部原始内容。

这样有机会省下的,是完成任务过程中的反复调用与无用输入。DeepSeek 在PTC 的官方设计记录中,也把这两类开销列为了需要解决的问题。对开发者来说,最终要比较的,是同样一项工作能否做好,以及做完之后的总账单。

这里有机会省下模型不必反复参与的过程。对于已经知道怎样处理的一批材料,程序可以执行完整流程,模型再针对留下的信息作判断。

图 3|V3.2 的工具调用推理保留机制。同一条用户消息引发的连续工具交互保留已有推理;新用户消息到来后移除此前推理。来源:V3.2 技术报告图

DeepSeek 对重复计算的处理,也能往前追溯。V3.2 报告曾指出,在连续工具交互中丢弃已有推理,会迫使模型重新分析整个问题。因此,团队调整了上下文管理,让此前的推理能够在这一过程中保留。

从模型怎样思考,到工具怎样执行,效率损失已经不能只在模型参数里寻找。

Harness 还记录提示、工具调用及结果,让开发者能够回看任务,检查重复处理和执行失败发生在哪里。

8 月 10 日的一项官方开发记录显示,DeepSeek 修正了极简模式的工具与提示词配置,让它使用与强化学习运行环境一致的持久 Bash,以保留连续操作的工作状态。

这种细节解释了模型公司为什么还要做执行框架。模型学会了怎样使用工具,实际运行时也得有合适的工具和环境。DeepSeek 把其中一套明确的运行方式开放出来,应用开发者就多了一个可以直接采用、检查和修改的参照。

这些改进逐渐汇到同一项工作中:服务端加速生成,模型减少重复推理,执行框架减少不必要的调用。过去是用户盯着 AI 想,现在还得让 AI 持续工作而不把费用和等待放大。

03、日常模型往上走,旗舰就得解决更难的问题

DeepSeek 并不是唯 一一家重新安排高端能力的模型公司。

7 月 24 日,Anthropic 发布 Opus 5,主打以 Fable 5 一半的价格,提供接近其前沿水平的能力,并把它设为 Claude Max 的默认模型。

Anthropic 甚至直接用 " 每项任务的成本 " 来介绍 Fable。在官方 CursorBench 3.2 测试中,最 大思考强度下的 Opus 5 接近 Fable 5 的最高成绩,任务成本约为一半。Cursor 联合创始人 Sualeh Asif 在同一份发布材料中,将其概括为以 Opus 的速度和成本,提供接近 Fable 的智能。

这与 DeepSeek 的方向无限相似:一旦高端能力可以更便宜地提供,原来的价格分层就需要重新校准。

Fable 和 Astra 的定位,可以为下一代 Pro 提供一个参照。Anthropic 把 Fable 放在耗时数小时、跨越多个应用,乃至持续多日的编程任务中;OpenAI 则将 GPT-6 Astra 定位于最困难的端到端工作,覆盖复杂推理、编程、研究和文档制作。

这类旗舰模型争取的是用户愿意交出更多时间和预算的复杂工作。用户给出目标,模型需要自行拆解任务、调用工具、检查结果,并在遇到问题后继续推进。它的价值,要由最终完成的工作来证明。

高端型号需要承担更完整的责任。用户交给它一个任务,期待拿回能够检查、能够使用的结果。模型要能保持方向、使用工具,在失败后继续推进,而不是每过几步就要求用户接管。

从这里看未来的 DeepSeek Pro,一个合理的猜想是:如果 Flash 真能承担现在 Pro 的大量工作,下一代 Pro 就可以把更多计算投入更困难、更长的任务,争取 Astra、Fable 所代表的产品位置。要是需要足够时间思考,得出的结果就要足够优秀。

这也解释了为什么原生多模态和 Harness 会变得重要。一个需要独立完成工作的模型,迟早要读到图表、看到页面,判断自己做出的界面是否符合要求。只会处理文本、只能给出建议,会限制它能够接手的工作。

早在 4 月发布 V4 预览版时,DeepSeek 就明确提到针对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等 Agent 产品进行适配,展示的成果中包括生成的 PPT 页面。模型已经在进入具体工具中的代码与文档工作。

现在,新 Flash 在更新结构和多模态能力,Harness 在调整执行方式。把这些动作放在一起,DeepSeek 要提高的效率,已经覆盖从一次推理到一项任务的过程。

对 DeepSeek 来说,提高效率有两种回报。减少完成任务所需的计算,可以降低成本;在相同等待时间里完成更多有效推理,则有机会解决更难的问题。后者会让 " 深度思考 " 继续向前,前者则决定这些进步能走进多少人的日常。

V4.1 Flash 目前仍是中间版本,全面替代 Pro、推理链变短和下一代 Pro 的定位,都还需要后续结果验证。本文引用的 DSpark 提速属于此前 V4 服务的测试,不能直接算成本次更新的成绩。

不过,下一轮竞争要回答的问题已经变了。Flash 要让更多这样的工作变得划算。Pro 要找到更多值得等待的工作。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 高峰 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论