21世纪经济报道 17小时前
AI疯狂星期四,DeepSeek-V4-Pro正式版波折上线
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

21 世纪经济报道记者 陈归辞

7 月到 8 月,大模型沙场战鼓频催,而过去的一天则堪称 " 疯狂星期四 "。

8 月 12 日晚间,国内外大模型厂商迎来新模型 " 三连发 ":DeepSeek API 文档中出现 DeepSeek-V4-Pro-0813,V4-Pro 正式版静默上线;Grok 4.6 发布,纸面测评得分逼近 Fable 5;参数规模达 2.4T 的 Qwen3.8 Max 也如期开放权重。另据记者了解,智谱新模型 GLM 5.3 也已接近发布,DeepSeek-V4-Pro 先行一步。

不过,V4-Pro 正式版的发布在 24 小时内经历了 " 一波三折 "。

模型上线数小时内,社区实测陆续出现异常反馈,本应进行长推理的 V4-Pro,思考时间经常不足十秒,长流程任务频繁提前收尾,部分场景表现甚至弱于 V4-Flash。8 月 13 日凌晨,有开发者用同一任务间隔几小时先后测试,结果差异悬殊,怀疑服务端进行过配置调整或版本切换。

8 月 13 日白天,官网首页通知与开放平台公告一度撤回,API 文档页面里的版本名则一直显示 DeepSeek-V4-Pro-0813。有业内人士注意到,思考强度分档 8 月 11 日就已在 API 文档里列出,13 日下午思考模式页有过一次修订。

当日晚间,DeepSeek 发布推文官宣 V4-Pro 正式版于网页端、App 及 API 全线上线,并同步公布了调价方案。官网首页通知恢复,官方更新日志中也首次出现了 8 月 13 日的相关条目。官方并未就上述变动及凌晨时段的服务波动作出说明。

此前虽有过大幅涨价预告,但调价方案中的涨幅依然超出部分用户的预期。此次调价将于 8 月 17 日 0 时生效,调整后将实行分时定价,高峰时段输出价格升至 27 元 / 百万 tokens,为现行价格的 4.5 倍;缓存未命中价格升至 9 元 / 百万 tokens,为现行价格的 3 倍;缓存命中价格则大幅上调至 0.30 元 / 百万 tokens,为现行价格的 12 倍。空闲时段价格统一为高峰时段的一半。

此外,在 8 月 13 日晚间 V4-Pro 正式版官宣一个多小时后,DeepSeek Harness(DSH)终于单独落地。DSH 团队的 " 黑鲸 " 公众号发布公告,宣布以 " 开发者预览版(v0.1 版本)" 名义,面向全球开发者开放测试,并同步以 MIT 协议开放源代码。

V4-Pro 正式版上线后的这一连串波折,背后究竟发生了什么,又意味着什么?

社区中对此众说纷纭,有人怀疑官方临时发错了模型版本,有人推测部署出现了问题,有人猜测 V4-Pro 的表现未达预期,暂时撤下以待后续满血版上线。

有业内人士向记者分析,这一系列迹象更像是发布环节出现了问题,当晚线上服务状态大概率发生过变动。外部目前无法确认此前调用到的是首发版本、回退版本还是修复后的版本,在官方说明版本状态之前,不同时段的实测结果之间缺乏可比性。

在该人士看来,晚间的官宣反过来坐实了白天的撤回,撤的是发布仪式,调用入口一直没动。分档参数早就写在文档页上,前一夜的问题是行为没跟着档位走,本该长思考的请求思考不起来。晚间官宣把 " 更灵活的思考强度控制 " 写成卖点,对照之下,指向的还是服务端配置。

新加坡无限对齐创始人、Codex 生态合作伙伴宋斐对记者表示,这里叠着三件不一样的事:深夜切 API 流量,白天撤页面公告,晚间把官宣、价目和思考开关补进同一套话术。流量最难退,因为第三方已经接上;页面和公告则随时能撤能发。API 名称从头到尾没有动过,第三方平台也没有发 V4-Pro 下线通知,能确认撤掉的,只有官网通知和开放平台公告。

他分析,版本号和官方跑分都没变,说明没有换过权重。模型本体若有问题,官方不会只撤页面,API 也会一起下。问题更可能在部署配置和配套节奏。他强调,正式版身份的确认和对标 Fable 5 的能力验证是两件事,前者在 13 日晚间完成了,后者要等第三方拿着刚开源的 DSH 在固定版本上复测之后才有答案。

此前,7 月 31 日上线的 DeepSeek-V4-Flash 正式版,因为出人意料的性能跃升和极致性价比而收获如潮好评,其祭出的大模型 " 斩杀线 " 也抬高了外界对 V4-Pro 正式版的期待。

但 V4-Pro 正式版上线后,市场评价却呈现分化:有用户认为其已达到 Fable 5 级别,也有用户表示失望。

从 DeepSeek 官方公布的评测结果来看,V4-Pro 正式版相较此前 V4-Pro 预览版实现代际提升,并整体优于 V4-Flash-0731。

而与前沿模型相较,从官方测评结果看,V4-Pro 在执行类任务上已追平 Anthropic 前沿模型,但在基础智能上仍存在一定差距。

具体来看,在考察终端操作能力的 Terminal Bench 2.1 测试中,V4-Pro-0813 得分 87.9,与 Fable 5 的 88.0 仅差 0.1 分,高于 Opus 4.8 的 85.0 分;在考察真实世界长周期工程任务能力的 DeepSWE 测试中,V4-Pro 得分 62.7,低于 Fable 5 的 70 分,但高于 Opus 4.8 的 58.0 分。

相比之下,在考察基础智能的 HLE 测试中,V4-Pro-0813 得分 42.7,低于 Fable 5 的 53.3 分和 Opus 4.8 的 49.8 分;在考察仓库级长程代码生成能力的 NL2Repo 测试中,得分比 Opus 4.8 低 8.2 分。

根据美国研究机构 Artificial Analysis 最新独立评测,V4-Pro-0813 的智能指数为 53 分,低于 Fable 5 的 62 分、Grok 4.6 的 61 分、Kimi K3 的 60 分和 GPT-5.6 Terra 的 57 分;同时,仅比 V4-Flash-0731 的 50 分高 1 分,与 6 月发布的 GLM-5.2 大致处于同一档位。有业内人士以 " 不及预期 " 形容其基准测试表现。

目前 V4-Pro-0813 的官方跑分尚未得到第三方复现。根据社区在 8 月 12 日模型上线后的即时反馈,V4-Pro-0813 处理复杂任务的完整度有所提升,但与 V4-Flash 的差距并没有想象中大,甚至在某些编程任务中不如 V4-Flash,整体表现没有超出预期,且不同时段的表现差异明显。" 以 Flash 数倍的参数做出来的模型不该是这样。" 有开发者指出。

与此同时,社区反馈显示,将 DeepSeek-V4-Pro API 接入 Claude Code 后,实际体验不及预期;而接入 OpenCode 后,表现则明显改善。

对于上述落差产生的原因,宋斐认为更多来自接入协议,而不是模型忽强忽弱。V4-Pro 正式版新增支持 Response API 和 Codex 接入,对已经在用 Codex 的团队,路径比走兼容层短,行为也好控一些。同一模型换框架,分差往往出在协议:推理状态回不回得全、工具预算谁说了算、并行能不能关,在长任务里这些差异会被放大。

随着 8 月 13 日晚间 DeepSeek Harness 预览版的推出,上述模型能力与实际体验之间的落差,有了可以验证的环境。

至于 8 月 12 日上线当晚社区反馈的思考时间过短、任务提前收尾现象,宋斐认为,这从工程上看更像推理服务的配置问题:思考模式有没有真正打开、预算如何映射到服务端。权重在几小时里反复换的概率低。

宋斐注意到,思考分档 8 月 11 日就在文档里,13 日下午思考模式页有过一次修订,正好卡在凌晨异常之后、晚间官宣之前。这个顺序和前述配置层修复的判断对得上,13 日晚间的官宣公告等于把修过的这层收进了正式说明。" 测试 V4-Pro 要显式指定思考档,默认档的结果参考价值有限。在官方把版本状态说清楚、外界能对着固定版本复测之前,建议先不要给模型本体下判语。"

眼下,V4-Pro 正式版相比于拼智能上限,更硬的仍是性价比。

根据 8 月 17 日前的现行价,其调用费是 V4-Flash 的 3 倍。Artificial Analysis 测评显示,V4-Pro 每项智能指数任务的加权平均成本为 6 美分,是 V4-Flash-0731 的 2 倍,不到 Fable 5 的 1/50,约为 Kimi K3 的十四分之一。不过,其成本已高于 GPT-5.5 Luna 的 5 美分。

调价后,按高峰时段计算,V4-Pro 的缓存未命中输入价格仍约为 Kimi K3 的 45%,相较海外旗舰模型依然便宜数倍。

宋斐指出,这轮调价中上调幅度最大的是缓存命中价格,从 0.025 元 / 百万 tokens 涨至高峰时段的 0.30 元 / 百万 tokens,涨至原价的 12 倍。靠高命中压成本的长上下文 Agent,成本压力将显现。而高峰时段输出价格则变为原价的 4.5 倍,也高于市场此前约 3 倍的预期。要建成本基线或做批量压测的团队,得在 8 月 17 日零点调价前做完。

在宋斐看来,此次 V4-Pro 正式版对按任务计费的 Agent 交付冲击更大,而对按智能上限计费的市场而言冲击相对有限。这还只是 DeepSeek 第一轮往 Agent 方向训练,后面仍有空间。

" 从初步接入和社区反馈看,V4-Pro 正式版适应性强,稳定性差。同一道题跑十次,一条轨迹很好,下一条出低级错,平均分没太大意义,多路尝试再加外部筛选,才是用法。现阶段要稳的团队可以继续用 V4-Flash 正式版;评 V4-Pro,放在协议对齐的环境里,等版本状态稳住再下结论。" 宋斐表示。

V4-Flash 和 V4-Pro 的正式更新,都是底座不变,仅通过后训练提升 Agent 能力。这也让后训练的重要性再次成为行业关注的焦点。

4 月 24 日发布的 V4 系列预览版中,V4-Flash 总参数规模为 2840 亿、激活参数 130 亿,V4-Pro 总参数规模为 1.6 万亿、激活参数 490 亿,均采用 MoE(混合专家)架构,并支持 100 万 tokens 上下文窗口。

7 月 31 日,V4-Flash 正式版上线。官方表示,在模型架构和参数规模均不变的情况下,仅通过后训练实现 Agent 能力提升。在 DeepSWE 测试中,V4-Flash 正式版得分从预览版的 7.3 跃升至 54.4。

两周后,V4-Pro 正式版上线,同样没有更换模型底座,通过后训练将 DeepSWE 得分从 12.8 提升至 62.7。

" 这说明 DeepSeek 的后训练已经成体系,而且能在不同规模的底座之间复用,前提是两套底座吃的是同一套数据。" 宋斐表示," 预览版分低,我一直不认为是能力不行。能力在权重里,只是还没被训到 Agent 任务上。后训练做的事,是把执行环境的任务分布写进权重。"

不过,V4-Pro 正式版的总参数规模是 V4-Flash 的 5.6 倍、激活参数是 3.8 倍,却没有带来等比例的分数优势,也引发业内关注。在 Artificial Analysis 的智能指数评分中,V4-Pro-0813 也仅比 V4-Flash-0731 高出 1 分。官方测试中,V4-Pro-0813 的 ALE 也只高 0.5 分,Toolathlon 高 3.8 分,DeepSWE、DSBench-Hard 这类高难任务高 7 到 8 分。

"Pro 的价值主要堆在高难任务、知识密集诊断和长链条恢复。" 宋斐表示,两款模型分工也清楚:Flash 铺量,Pro 啃难题、接失败,二者并非替代关系。

开发者 Jun Song 则直言:" 中国模型公司在小模型上表现得异常出色,例如 Qwen 27B、V4 Flash 和 GLM-5.2,但到了更大的旗舰模型,能力提升往往没有随着参数同步放大。" 他认为其原因 " 也许是训练算力不足 "。

对 DeepSeek 而言,后训练作为 Agent 能力提升路径已经得到验证,但模型能力要继续向上突破,后训练也是其短板,训练素材不足的问题正在凸显。

" 第三方用极简框架测出 V4-Flash 正式版的分数能和官方分数打平,说明这轮增益已经写进权重,自家积累的可验证任务,模型基本学透了。同一批任务反复训练,收益会递减,继续提升需要更宽的任务来源。这也是他们同步推公共 Harness 的原因。" 宋斐指出。

海通国际近期研报指出,模型竞争正从参数规模转向后训练与系统工程。未来模型实际效果将越来越取决于 " 模型+Harness+工具+数据 " 的整体组合,单纯依靠基础模型能力建立壁垒的难度继续上升。

在宋斐看来,DeepSeek Harness 不只是开发工具,也是标准接口和数据入口。在条款允许的范围内,开发者跑长程任务留下的轨迹和纠错,可以回流训练。谁占住开发框架,谁就相当于让付费用户帮自己做强化学习里最贵的那一段。

因此,8 月 13 日 DSH 预览版的发布及其后续反馈与进展,尤其值得关注。

在发布的公告中,DeepSeek 提出了 DSH" 一切皆插件 " 的设计理念。其采用插件式开放架构构建 Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。

同时,DSH 提供四种运行模式——标准模式、PTC 模式、极简模式、创造模式,各模式默认加载不同的插件集合。其中 " 极简模式 " 仅保留一个 shell 工具与一个文件编辑工具,官方称是用于最小环境下的模型基准测试。这意味着,第三方复现官方评测分数的环境条件已经具备了。

此外,模型看到的一切,都会写入仅追加(append-only)设计的会话日志,包括系统提示词、思维链、工具调用与结果、子 Agent 调度,以及每一次上下文注入。在 Trajectory 视图中,可以按来源查看这些信息。恢复、分叉、检索与回放也都共享同一份事件流。

宋斐认为,DSH 预览版的架构,把模型在 DSH 里做成插件,与工具、沙箱、界面并列,可替换。也就是说运行时是主体,模型是其中一个部件," 这个位置由模型厂自己排出来,分量不一样 "。

更进一步,他指出,轨迹这层,会话日志记全了模型看到的一切,但记录不等于判定,事件流里还看不到步骤级的对错标注,预算、允许集和停止条件也没有成为产品。对高方差模型,运行时的价值一半在让模型发挥,另一半在让它停得下来。v0.1 版本把发挥的一半搭起来了,停的那一半还空着。

DeepSeek Harness 终于真的对外开放了,而模型在这之前的 24 小时里,经历了静默上线、首页公告撤回、晚间再官宣的过程。一边是波折的模型发布,一边是单独成篇、开源开放的运行时发布,两场同天上演,轻重自见。V4-Flash 与 V4-Pro 正式版与其说是 " 价格屠夫 " 的又一次亮剑,不如说是这条线的起点。

更多内容请下载 21 财经 APP

评论
大家都在看