
就在今晚,DeepSeek 正式发布并开源 DeepSeek Harness(DSH)开发者预览版。
这是一个由 DeepSeek 自己开发的 Agent Harness:它不是新的基础模型或者一个 API 客户端,而是负责把模型接入文件系统、终端、网页、代码工具和其他 Agent,并组织上下文、工具调用和任务执行的一整套 Agent 运行框架。

(来源:X)
目前 DeepSeek Harness 已在 GitHub 开源,并可以通过 npm 直接启动。按照官方说明,用户安装 Node.js 后运行 npx @deepseek-ai/dsh web,即可在本机启动 Web UI。不过官方也特别强调,目前产品仍处于 Developer Preview 阶段,接下来快速迭代过程中可能出现破坏兼容性的修改。

(开源地址:https://github.com/deepseek-ai/deepseek-harness)
在持续一年多围绕模型性能、开源权重和低价 API 展开竞争之后,DeepSeek 第一次把手伸到了模型输出之后的执行层。或者我们可以换一种更直接的说法:DeepSeek 终于有了一个属于自己的 Vibe Coding 入口。
这一动作其实早有预兆。7 月 31 日,DeepSeek 发布 V4 Flash 正式版时,就在更新日志中留下了一行容易被忽略的信息:在公开 Code Agent benchmark 中,V4 Flash 使用的测试框架正是 " 即将发布 " 的 DeepSeek Harness 极简模式。也就是说,Harness 在正式公开之前,已经开始参与 DeepSeek 对自身模型 Agent 能力的评估。
就在 Harness 发布前,DeepSeek 还完成了另一块拼图。
8 月 13 日早些时候,DeepSeek-V4-Pro 正式版上线 App、Web 和 API,API 对应模型已经更新为 DeepSeek-V4-Pro-0813。V4 Pro 支持 1M Token 上下文、最高 384K Token 输出。官方尤其强调了 Agent 能力提升:Terminal Bench 2.1 得分达到 87.9,DeepSWE 为 62.7,Toolathlon-Verified 为 74.1,DSBench-FullStack 为 71.1。

(来源:DeepSeek)
如果把过去两天的两次更新放在一起看,逻辑就变得清楚了:V4 Pro 提供更强的基础模型能力,Harness 则负责把这种能力真正组织成可以工作的 Agent。
这也是 Harness 最关键的不同。当传统聊天模型收到一个问题,然后返回一段文本;Coding Agent 则需要不断重复 " 理解任务—寻找文件—修改代码—运行命令—检查结果—继续修改 " 的循环。这里决定最终效果的已经不只是模型本身,还包括模型拿到了什么工具、系统提示词如何组织、上下文怎样压缩、错误之后是否重试、任务如何拆分,以及什么时候应该调用另一个 Agent。
而 DeepSeek 对 Harness 给出的架构答案是:Everything is a plugin,一切皆插件。
官方文档显示,DSH 建立在 Cordis 之上,包括模型适配器、工具注册、Session Log,甚至 Agent Loop 本身都被设计成可以替换的插件。模型、文件系统、Shell、网页访问、Skill、子 Agent、存储、安全策略和交互界面,都可以通过配置重新组合。因此,它并不只是 "DeepSeek 版 Claude Code" 或者 "DeepSeek 版 Codex"。

图|DeepSeek Harness 提供标准、PTC、极简和创造等多种 Agent 预设,不同预设对应不同的工具、提示词和运行能力。
提前参与内测的报道显示,DSH 已经包含项目管理、长任务协作、多 Agent 编排、上下文管理、联网搜索、Skill 等本地 Agent 工作台常见能力;同时可以通过不同 Agent Preset,为同一套系统安装不同的提示词、工具和运行规则。
以官方目前开放的形态来看,DeepSeek Harness 更接近一套运行在用户本地环境里的 Agent 工作台。
它不只给出答案,还可以进入实际工作环境继续行动。比如,用户可以把一个代码项目所在的文件夹交给它,让它先阅读项目结构和文档,再寻找相关代码、修改文件、调用终端运行程序或测试;如果测试报错,它还可以根据错误信息继续定位问题、再次修改,而不是每一步都等用户复制粘贴代码和报错信息。
这些能力主要通过 Web UI 提供,同时还有面向终端用户的 TUI、适合脚本和 CI 的 Headless 模式,以及 ACP、JSON-RPC 和 Python SDK 等自动化入口。换句话说,同一套 Harness 既可以做成人直接操作的编程工作台,也可以被接进自动化流程:例如收到一个任务后自动检查代码、执行测试,完成后再返回结果。提前体验资料显示,这些形态共享同一套模型、会话和底层插件,只是通过不同组件组合成不同的产品形态。
它还支持更复杂的长任务和多 Agent 协作。一个主 Agent 可以把工作拆给多个子 Agent,例如让一个负责搜索项目和资料,一个负责修改代码,另一个负责执行测试,再由主 Agent 汇总结果并决定下一步。官方框架同时提供计划、目标、待办事项和后台任务等机制,目的就是让 Agent 不必局限在 " 一问一答 ",而可以持续完成一串彼此关联的操作。
这让 DeepSeek 开始进入 Claude Code、Codex 等产品已经率先展开的竞争。基础模型公司不再满足于提供一个 API,而是进一步争夺模型和真实计算环境之间的执行层。
此前 OpenAI 甚至已经直接使用 "harness" 来描述 Codex 的这部分能力。其今年公开的技术文章将 Codex CLI 定义为本地软件 Agent,并把负责组织模型、工具和用户交互的 Agent Loop 称作 Codex Harness。Codex 桌面端随后又进一步加入多 Agent 并行、Skills、Automations 和 computer use。
这背后还有一个更重要的原因:AI Coding 正在成为观察和训练 Agent 能力最理想的场景之一。
相比写文章、回答问题等开放式任务,代码拥有密集而且相对客观的反馈。程序能不能运行、编译是否成功、测试是否通过、终端返回什么错误,都可以直接被机器验证。因此,一个 Coding Agent 可以不断形成 " 执行—获得反馈—修改—再次执行 " 的闭环。比如修复一个 Bug 时,模型修改代码后可以直接运行测试,再根据新的报错继续调整,不止停在 " 给出一段代码建议 " 这一步。
这使 Coding 也越来越像基础模型 Agent 能力的实验场。模型是否会规划、能否稳定调用工具、面对错误能否调整策略、能不能完成数十甚至上百步的长任务,都会在真实代码环境中暴露出来。
而 Harness 控制着这个闭环。DeepSeek Harness 的 Session Log 设计要求,凡是模型真正看到的内容都必须能够从日志重建,包括用户消息、模型请求、工具调用、工具结果、上下文压缩和权限变化。其目的首先是让任务能够恢复、回放、调试和审计,但从模型工程角度看,这同样意味着 Agent 的执行过程开始变得可以被系统化记录和分析。
这也是为什么,同一个模型放进不同 Harness,实际表现可能出现明显差异。提前体验 DSH 的媒体曾将同一版本 V4 Flash 放入不同 Agent 框架完成相同任务,结果出现了肉眼可见的差异。当然,单次测试无法证明哪种 Harness 普遍更强,但至少说明,工具、提示词、上下文组织和执行策略已经成为 Agent 最终性能的一部分。
过去谈 DeepSeek,竞争焦点几乎始终落在模型本身:参数规模、训练成本、Benchmark 和 API 价格。但到了 V4 Pro 与 DeepSeek Harness,这条边界正在发生变化。
模型仍然决定智能的上限,但当模型开始真正进入代码库、终端和长期任务后,如何把这种智能接入真实环境,开始成为另一半问题。DeepSeek Harness 的意义也正在这里:它不仅给 DeepSeek 补上了一个 Vibe Coding 产品入口,也让 DeepSeek 第一次拥有了一套自己定义的 Agent 执行框架。
从 V4 Pro 到 Harness,DeepSeek 正在从 " 造一个更强的模型 ",走向 " 让这个模型真正开始工作 "。
参考链接:
1.https://github.com/deepseek-ai/deepseek-harness
2.https://www.npmjs.com/package/@deepseek-ai/dsh
3.https://api-docs.deepseek.com/updates/
注:封面 / 首图由 AI 辅助生成


登录后才可以发布评论哦
打开小程序可以发布评论哦