(本文作者为 光子星球,钛媒体经授权发布)
近期,DeepSeek 持续上演反转。
8 月 12 日,没有发布会,没有预告,DeepSeek 悄悄更新 API 文档,编号为 "0813" 的 DeepSeek-V4-Pro 正式版模型深夜静默上线。
高关注度和期待之外,是现实体验与官方跑分之间的落差,还有一经上线便预告涨价的质疑。
8 月 13 日,距离新模型发布不到 24 小时,DeepSeek 官网首页发布的横幅和开放平台公告突然被撤下。API 文档中模型名称没变,开发者仍可正常调用,但官方保持沉默。
事后,有开发者发现 DeepSeek 在 Hugging Face 后台代码仓库疯狂抢修,疑似因为前端接口、后端推理栈与权重配置出现了严重错位,导致体验 " 翻车 "。
同天晚上,DeepSeek 重新发布公告确认 V4 Pro 正式版上线,同时开源 DeepSeek Harness 开发者预览版,一切又回到了主场。
DeepSeek 曾给出过一个公式:Model+Harness=Agent。这意味着,对可执行任务的 Agent 来说,只有模型是不完整的。Harness 的可控、可观测、可回溯的特性,补上了模型所缺失的另一半。
模型是大脑,负责思考、推理和理解意图。但纯语言模型只能输出文本,无法直接操作文件、修改数据库和浏览网页。Harness 是 " 身体 " 和 " 神经系统 ",它提供了模型与外部世界交互所需的一切,包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。
没有 Harness,模型只是一台会说话的引擎,但无法成为真正干活儿的 Agent。DeepSeek 试图通过自身打造的 Harness 系统,将模型性能发挥到最大化。
从我们的测试结果来看,也的确如此。在 DeepSeek Harness 加持下,DeepSeek V4 Pro 正式版的响应速度更快,且比接入 Claude Code 缓存命中率提升了 1%。
祛魅和争夺范式
" 一切皆插件 " 是 DeepSeek Harness 最核心的设计理念。简单来说,就是从模型、工具到最核心的 Agent Loop,都拆解为可独立、组合的插件。
这个理念由北大与 DeepSeek 联合提出的 " 时空可组合性 " 范式支撑,该范式将 Agent 组件拆解为两个维度。
一是时间可组合性通过 " 可逆效应 " 机制,让系统自动记录并撤销组件卸载后的副作用,加载过程即决定卸载过程,确保系统长期稳定。二是空间可组合性通过 " 响应式共效应 " 实现声明式依赖管理,组件只需声明需求,运行时就能自动协调依赖变化,实现动态激活与停用。
两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness 因此可实现 " 无特权核心 ",所有组件包括 Agent 主循环均可替换,开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的 Agent 基础设施奠定了方向。
在 OpenAI、Anthropic 等巨头纷纷定义自己的 Harness 时,DeepSeek 的思路显得独树一帜。
OpenAI 和 Anthropic 的战略是 " 向下整合 ",即通过打造体验极致、深度绑定自家模型的 Harness,巩固其在 AI 应用层的优势;DeepSeek 的战略是 " 横向铺开 ",不再满足只做一个优秀的模型供应商,而是试图通过开源一个模型中立、高度模块化的 Agent 底层标准,成为下一代 AI 应用的基础设施。
网传的 DeepSeek Harness 内测入选项目名单同样释放了强烈的信号,入选项目高度集中在能夯实 Agent 能力的基础设施领域。其项目主要围绕 MCP 插件、代码智能体、运行时、编排框架、可视化 UI 与多智能体调度等方向,直指 Agent 在真实世界落地的核心难题。
DeepSeek 的一系列操作,可视为一场精心设计的 " 祛魅 " 运动。DeepSeek 开源 Harness,并大力扶持各类基建插件,本质上是在做一件事:将 " 如何构建一个强大的 Agent" 的一整套方法论和源代码,公之于众。
在此之前,OpenAI 和 Anthropic 的 Harness 更像一个 " 黑箱 ",其内部优化是核心机密,如何打造 Agent 产品被视为一种 " 特权 "。DeepSeek 通过开源和 Cordis 插件理论,主动拆解了这个黑箱,并证明 Agent 的强大不在于某一个神秘的内核,而在于一套可组合、可替换的工程组件。
当 Harness 被充分祛魅,成为一个透明、可被随时替换的组件后,整个价值链上,唯一不可被标准化、仍会持续进化的,就只剩下最底层的 " 模型 " 本身了。
如果把 DeepSeek 的模型、开源、Harness、涨价四个动作连在一起看,就会发现 DeepSeek 的目标非常明确。先建立生态,再定标准,然后用最强的模型性能,完成商业价值的最终变现。
Harness 和开源就像是免费修建的高速公路,前期用来吸引车流,而当车流足够多时,顺势提高燃油的价格,便成为了最高效的商业兑现方式。
砍掉 prompt,场景一次跑通
昨天的文章里,我们测评了 DeepSeek-V4-Pro-0813 的七项复杂任务,唯独指环王那题没有跑完整。当时为了赶时间,只给了《指环王》第一章的 3 句开头。
DeepSeek-V4-Pro 正式版实测:山不在高,有 " 梁 " 则灵
恰好 DeepSeek Harness 也出来了,我们就在 DeepSeek 自家的 Harness 里跑这次完整的测试,看看自家的工具配自家的模型,能擦出怎样的火花。
安装的过程就不赘述了,推荐大家用 npm(Node.js 的默认包管理器,安装并管理项目所需的各种第三方库,可以简单理解为一个开放的应用市场)安装,也方便升级和安装其他插件,可以直接运行 npx @deepseek-ai/dsh web 启动,如果卡住不动的话,可以先运行一遍 npm install -g @deepseek-ai/dsh,然后再运行刚才的命令就可以顺利启动了。
初次打开和大部分 Agent 一样,只不过在 DeepSeek Harness 这里暂时还是极简的画风。
装好环境之后正式开始今天的测试,《指环王》这个基准测的不是 " 会不会画一只鹈鹕 ",而是 " 读懂一段文学→理解一个世界→把世界程序化搭出来 " 的完整链路,是目前圈内最狠的 Agent 考题之一。
昨天的测试为什么不算数?因为我们当时只给了 3 句开头,而 Karpathy 给 Opus 5 的是原著第一段。今天我们把原文补齐:第一章前段完整文字,从比尔博宣布 111 岁生日宴会,到霍比屯议论,再到弗罗多身世往事,共计 1817 个词、23 段,一字不改。
第一次测试,我们按 " 评测就该严谨 " 的思路,把提示词写得滴水不漏,1817 个词的原文,加上场景要素清单(洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷),再加上运镜要求、灯光要求、比例要求,一共五条硬性要求。
结果很打脸,第一次生成的效果非常粗糙,叙事也不完整。场景是搭出来了,但离 " 霍比屯的生日派对 " 相距很远。效果呈现上,运镜支离破碎,画面像是赶工出来的半成品。穿模很严重,山坡上站的小人像是插了一堆棒棒糖。我们复盘了一圈,把原因归结为提示词太长了,列出的场景限制了模型的发挥。
第二次,我们把提示词砍到只剩目标,读懂原文,用 Three.js 搭出霍比屯生日派对的 3D 世界,运镜按原文节奏走,保存为完整可运行的 HTML 文件。场景要素、灯光、比例要求,全部删掉。
场景竟然一次就跑通,洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人,该有的都有;角色只有轻微漂浮和穿模,属于 " 能看出是霍比屯 " 的范畴;运镜叙事成立,按原文节奏从俯瞰霍比屯推到比尔博,再扫过议论的人群,最后环绕宴会长桌。
同一个模型,同样的原文,一个细致入微的提示词换来翻车,一句直白的目标换来及格以上的结果。看来现在顶级的模型反而不需要详尽的提示词,只需要用直白简洁的话告诉他目标就可以了,说多了反而效果会变差。
这不是孤例,GPT-5.6 Sol 刚发布时,社区就有人反馈,套上精心优化的提示词和流程 skill,反而会让模型陷入死循环。
这个发现值得单独提出来,提示词的作用正在从 " 写剧本 " 变成 " 定目标 ",给顶级模型写小作文的时代可能真的过去了。
DeepSeek Harness 到底行不行?
回到今天的正题,DeepSeek Harness 配自家的 V4 Pro,表现如何?
响应更快了。同样的测试,DeepSeek Harness 里的响应比前一天在 Claude Code 里接入时更快。
缓存命中率涨了一个点。前一天在 Claude Code 接入是 98%,在 DeepSeek Harness 里是 99%。这个提升看起来小,但在长上下文任务里,缓存命中率每涨一个点,都是实打实地关系到成本和生成速度。
再看测试本身,第一次的长提示词翻车,发生在 DeepSeek Harness 环境里;第二次反转,也在同样的环境。但全程没有环境相关的报错、卡顿、上下文丢失,两轮测试的对比是干净的,变量只有提示词本身。
作为一个刚发布的开发者预览版,这是很加分的稳定性,而且DeepSeek Harness 还会把运行过程中每一步都显式的呈现出来,你可以看到模型是怎么工作的,这是一个很好的创新。
短期内,DeepSeek Harness 所能产生的作用还很有限,作为普通用户很难像使用 WorkBuddy 一样在工作中提效。
但从长期来看,DeepSeek Harness 与 DeepSeek 系列模型,形成了难以割裂的增强闭环。
Harness 作为完全开源的 Agent 框架,定义了 " 模型如何被调用、工具如何被组合、任务如何被编排 " 的底层标准,吸引了海量开发者和真实任务涌入。而这些真实任务的执行轨迹,通过 Harness 内置的可观测体系,源源不断地回流,为 DeepSeek 模型下一轮训练与优化提供天然数据养料。
反过来,DeepSeek 模型能力的每一次跃升,Harness 又能第一时间通过内置适配器将其能力释放到插件生态中。
当这套飞轮转起来,开发者的选择就变得不再困难。因为使用 DeepSeek Harness,就会得到一个始终与最强模型同步进化,且无需二次适配的开箱即用系统。
这正是 DeepSeek 所定义的 "Agent=Model+Harness" 的终极形态,一个彼此增强又不可分割的完整个体。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体 App


登录后才可以发布评论哦
打开小程序可以发布评论哦