原标题:DeepSeek 下半场开始 来源:凤凰网
8 月 13 日傍晚,DeepSeek 官方终于发声,两个重要信息发布。其一,是 DeepSeek V4 Pro 正式版发布,并同步在 APP、网页端和 API 更新上线。用户可以通过 APP 或网页端选择 " 专家模式 " 使用全新的 V4 Pro 正式版模型,API 模型名不变。
其二,有着一只黑色鲸鱼头像的 "DeepSeek Harness 团队 " 迎来首次发文,宣布 Harness 开发者预览版正式上线,并以 MIT 协议开放源代码。
如此前预告,V4 Pro 正式版与官方自研 Harness 同步亮相,由于我们此前已经着重介绍过 V4 Pro,本篇文章将重点为大家解析,DeepSeek Harness 为什么有看点。
以及经过今天,DeepSeek 会不会从一家模型公司,变成一家更难定义的公司。
同一个模型,换套外壳像换了个人
要理解 Harness 为什么重要,得先理解一个反直觉的事实:在 Agent 时代,决定一个 AI 能不能干活的,不只是模型。
8 月 6 日和 11 日,智能体工具公司 Composio 通过两次测试实验,试图证明 Harness 的价值。研究者把同一个 DeepSeek V4-Flash 接入八种不同的 Harness,也就是套在模型外面的执行系统,让它们分别完成三十项多步骤任务。这些任务不是问答,而是要求 Agent 进入 Gmail、Google Calendar、GitHub、Slack 等真实应用,调用工具并改变应用状态,每项最长运行十五分钟,全部检查通过才算成功。
结果差距不小。完成最多的 Pi Agent 通过了二十项,最少的 OpenCode 只通过十四项;八种 Harness 总共运行二百四十次,仅一百二十九次成功;三十项任务中,只有六项被所有 Harness 完成。在成本方面,同样完成十六项任务的 Claude Code、Codex 和 DeepAgents,每完成一项成功任务的估算成本分别约为 0.195 美元、0.081 美元和 0.045 美元。同一个模型,差了四倍多。
这意味着,模型划定能力的上限,Harness 决定这份上限最终能兑现多少、要花多少钱兑现。一项长任务跑下来,执行系统要不停地做判断,上下文里留什么、丢什么,什么时候调哪个工具,工具报错了是重试还是换路,模型说做完了到底信不信、要不要再验一遍。任何一步处理不好,模型就算思路对,也可能在真正改文件、提交代码时功亏一篑。
值得一提的是,这是 DeepSeek 走红以来,极少数提前开放内测的项目。
多个开发者在发布前就拿到了 Harness 内测资格,有人内测发现,让同一个 V4-Flash 分别在 DeepSeek Harness、Reasonix 和 Codex 中完成同一款游戏,会跑出截然不同的结果。这说明,当模型完全相同,执行系统提供的工具、提示词、上下文组织和执行策略,足以显著改变最终产物。
这恰恰是 DeepSeek 重视自研 Harness 的原因。DeepSeek 内部曾认为,Agent 要解决持续学习问题,最终让 AI 加快 AI 研发。顺着这条线看,Harness 就不是一个外挂的编程工具,而是模型进入真实研发任务的工作台。
除此之外,一家靠低价和模型能力立足的公司,如果任务交付、失败反馈和开发者入口长期挂在别人的系统里,即便其在价格上再有优势,却决定不了一个任务究竟烧掉多少 Token、要重试几次、什么时候才算真正完成。
一切皆插件,DeepSeek 不做谁的替代品
Harness 到底是什么?市面上最省事的说法是 "DeepSeek 版 Claude Code"。但用完内测版的人普遍认为,这个定位不准确。
据 DeepSeek 官方文档,Harness 的核心设计哲学是 "Everything is a plugin" ——一切皆插件。它基于 Cordis 插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有 Agent 能力均由插件组合而成。开发者不需要改动 Harness 源码,就能在配置中选择、替换或扩展任意一项能力。
这和通常理解的插件不是一个量级。VS Code 的插件是给编辑器加功能,Codex 的插件是给 Agent 加工具;而 Harness 的插件可以换掉 Agent 的大脑、工具箱、规则乃至整张脸。
据多位参与内测的人士透露,内测期间开发者在做插件这件事上玩疯了," 大伙都不好好内测了,跑去写插件了 ",在短短几天内就出现了几百个插件——有人直接改了整个工作界面,有人用纯插件实现了 " 跨会话长期记忆加后台自我进化 ",让模型定期回头审视自己的工作记录,把临时经验压缩成长久知识。
还有人评价称,开源社区治理可能也是 DeepSeek 接下来要面临的难题。
另一处关键设计是可追溯性。Harness 采用只追加(append-only)的会话日志,模型看到的一切——系统提示词、思维链、工具调用与结果、子 Agent 调度、每一次上下文注入都会被完整记录。上下文压缩不会删除原始历史,只是用替换事件改变模型此后看到的表象。开发者可以在 Trajectory 视图中按来源追溯,支持恢复、分叉、检索和回放。官方文档把这一原则概括为 " 模型可见,即已记录 "。
这背后是一种典型的系统工程思维。据报道,DeepSeek Harness 团队负责人崔添翼本科毕业于浙江大学计算机系,曾在量化交易机构 Jane Street 任职九年,2026 年 3 月加入 DeepSeek,5 月 Harness 内部立项。高频量化交易系统的核心壁垒从来不是策略多聪明,而是极端复杂环境下的稳定执行、异常兜底、全程日志追溯和风险可控——这恰好是 AI Agent 从演示走向生产最缺的那块拼图。有内测开发者用 " 稳如老狗 " 形容它跑长任务时的表现:任务断了自动存档,下次接着跑,不用从头再来。
值得注意的是,Harness 没有把自己关在 DeepSeek 模型的围墙里。它默认支持接入 Kimi、OpenAI、Anthropic、Google 等近四十家大模型。可能别家倾向于做一个现成的 Agent,但 DeepSeek Harness 更像一套组件,开发者可以自己决定 Agent 应该是什么样子,怎么工作。
当然,官方保持了清醒。公告表示,作为早期预览版本," 当前仍有许多细节有待改进和打磨,核心插件与基础接口也将在后续快速迭代 "。事实上,这次内测的媒体之一爱范儿就感叹,很难想象,以快著称的 DeepSeek 有一天运行一项编程任务的时间也会来到半个多小时。v0.1 的版本号也说明,这条黑鲸刚出水,远没到畅游的时候。
从卖 Token 到交结果,黑鲸的野心
Harness 的浮出水面,暗合着整个 AI 行业的一次转向。
过去数年,大模型公司的竞争集中在参数规模和基准跑分上。但进入 2026 年,头部模型的基础能力快速收敛,单次问答的差距不断缩小,价格战却愈演愈烈。单纯卖 Token 的商业模式,天花板已经肉眼可见。行业逐渐意识到,AI 产业的核心价值不在模型输出,而在场景落地——同样的 Token 消耗,闲聊问答价值微薄,而修复一个 Bug、完成一次功能开发,可以创造数倍的商业价值。
DeepSeek 的新发布,意味着其从卖算力走向交结果。在旧模式下,客户按 Token 调用量付费,不管模型有没有真正解决问题;在新模式下,付费的锚点从消耗了多少算力转向完成了什么任务。
这次 DeepSeek Harness 发布,广受开发者好评还在于另一重原因。DeepSeek 不定义 Agent 本身,而是利用开源社区的扩散能力,去推崇一种 Harness 方案。这是一条更宏大,也更难的路径。
并且,Harness 面对的是 Claude Code 和 Codex 已经验证过的成熟市场,后两者背靠 Anthropic 和 OpenAI 的模型迭代与商业资源,先发优势明显。开源之后,插件生态能否自发繁荣、开发者是否愿意把生产环境托付给一个 0.1 版本、国内市场的付费习惯能否支撑 " 按结果付费 " 的新逻辑,都是悬而未决的问题。DeepSeek 自己也表示,核心插件和 API 仍将快速演进,这意味着早期接入者要承担接口变动的成本。
8 月 13 日这一天,太平洋两岸各有一场发布。马斯克为 Grok 4.6 站台,称其 " 智能、快速且性价比极高 " ;DeepSeek 什么都没说,只是一味丢更新。
喧嚣与沉默之间,是两种商业哲学的分野。
我们想要称其为 DeepSeek" 史上 * 潜力项目 ",不是因为它今天已经最强。V4 Pro 与 sota 模型仍有差距,Harness 还只是 v0.1 的开发者预览版,涨价后的市场反应有待观察,生态建设更是长路漫漫。潜力之所以是潜力,恰恰因为它尚未兑现。
但如果把时间线拉长,从 R1 到 V4,从模型到 Harness,DeepSeek 走的每一步都踩在同一个方向上:把前沿能力压到可负担的成本,再把可负担的能力接入可落地的系统。
黑鲸已经出水。至于它能游多远,在属于开源社区的未来里。


登录后才可以发布评论哦
打开小程序可以发布评论哦