
AI 应用风向标(公众号:ZhidxcomAI)
作者|毕伟豪
编辑|漠影
智东西 8 月 4 日报道,8 月 1 日,DeepSeek 的 Agent Harness 团队负责人崔添翼发文招募 DeepSeek Harness 内测人员,要求申请者参与过开源 Agent 项目的建立和维护,并提交 GitHub 仓库作为代表作品。

一条内测招募帖,很快变成了一场 Agent 开源生态的大摸底。大量开发者带着自己的项目涌入评论区,从个人 Harness、Coding Agent,到记忆系统、安全工具、评测框架,几乎覆盖了当前 Agent 基础设施探索的各个方向。
据开发者统计,截至 8 月 3 日上午 11:30,共有 769 位报名者、去重后 712 个开源仓库、合计超过 120 万 Stars,跨越了 18 个赛道,评论区秒变 " 开源 Agent 路演 "。

统计仓库地址:
https://github.com/Octo-o-o-o/deepseek-harness-applicants
从目前公开信息看,DeepSeek 已经在内部使用 Harness 完成 DeepSeek-V4-Flash 正式版的基准测试,而社区也开始猜测,DeepSeek 未来可能会基打造一款面向软件工程场景的 AI Coding Agent。
按照社区流传的说法,这款产品或将具备自主规划、工具调用、代码执行等能力,并围绕长周期 Agent 工作流加入 Memory、项目仓库感知(Repo Awareness)等机制,定位上可能会对标 Claude Code、Codex 等现有 Coding Agent 产品。

这些信息目前尚未得到 DeepSeek 官方确认。不过,从此前公布的 Harness 基准成绩来看,DeepSeek 测试的重点本身就集中在终端操作、多工具调用、全栈开发等长流程任务场景。
若社区预测成立,Harness 承担的角色可能正是连接模型能力与真实软件工程流程的执行层。
而这场由 769 位开发者、712 个开源仓库参与的 " 评论区路演 ",恰好提前暴露了一个 AI Coding Agent 走向工程化需要持续升级的能力版图:
如何让 Agent 长时间稳定运行、如何管理项目上下文和记忆、如何控制工具调用风险,以及如何在真实开发环境中完成从理解需求到交付代码的完整闭环。
一、DeepSeek Harness 重点关注的,是模型之外的 Agent 执行层
关于 Harness,业内一直有这样一个公式:
Model+Harness=Agent。
模型负责理解需求、推理和生成方案,Harness 负责把这些能力落到真实环境中:调用工具、操作终端、读写文件、管理上下文、处理执行过程中的错误,最终完成一个完整任务闭环。
把目前公开信息放在一起看,DeepSeek Harness 的定位已经逐渐清晰:它并不是一个单纯的代码生成工具,而是在模型和真实软件工程环境之间增加一层 " 执行系统 "。
这一点也在 DeepSeek-V4-Flash 成绩单中的五组基准里有所体现,Terminal Bench 测试终端环境操作,Cybergym 测试安全攻防能力,Toolathlon 测试多工具调用,DSBench-FullStack 和 DSBench-Hard 则聚焦全栈开发任务。

这些测试的共同特点是:任务链条长、步骤多,需要 Agent 持续调用工具并根据反馈调整策略。
DeepSeek 选择测试的方向,更接近一个能够自主执行软件工程任务的 Agent。这也和社区流传的对标 Claude Code、Codex 等产品的目标一致。
除了基准之外,DeepSeek 的生态动作也透露出类似信号。目前公开信息显示,DeepSeek-V4-Flash 已支持 Responses API,并适配 Codex,走向标准化工具调用协议;识图模式正在灰度,用于补充代码 Agent 在理解架构图、报错截图等视觉信息上的能力。

这些动作共同指向一个趋势:未来 Coding Agent 的竞争,不只取决于模型能力,也取决于模型之外的工程基础设施。
二、769 份报名记录,暴露了 Agent 工程化的三大进化方向
769 份报名记录里,开发者关注的是一个非常现实的问题:
当 Agent 需要独立完成一个真实工程任务时,哪些方面还需要优化?
首先是长任务执行能力。这是 Agent 从 Demo 走向生产的第一道门槛。DeepSeek 公布的五组基准,本质上都在测试 Agent 是否具备持续执行复杂任务的能力。如果 Agent 只能完成一次调用,就无法覆盖 Terminal Bench、DSBench 这类需要多步骤、多工具协作的任务。
从报名项目来看,智能体框架和编程智能体是最大的两个方向,合计 242 个,占全部项目约三分之一。
Top 10 高星项目中,deer-flow(79k 星)探索长周期 SuperAgent 框架;CodeWhale(40k 星)是由 DeepSeek 原生项目发展成的编程智能体框架;orca(36k 星)关注多 Agent 编排。

这些开源项目路径不同,但都在回答同一个问题:如何让 Agent 在 " 持续执行 " 上走得更远。
其次是上下文和记忆管理。当任务从几分钟延长到几个小时,Agent 面临的除了推理能力问题,还有如何保存状态、理解项目历史,并在后续任务中正确调用已有信息。
在报名统计中,记忆与上下文相关项目共有 56 个,累计 194k 星(剔除头部项目 vllm 的 88k 星后仍约 106k 星)。开发者正在尝试 Git、数据库、知识图谱等不同路线,但 Agent 记忆目前仍没有统一答案。

最后是评测和安全。研究与评测、安全治理两个方向各有 24 个项目,是报名生态中规模较小的类别,但决定着 Agent 能否真正进入生产环境
有开发者尝试建立跨 Harness 评测体系;有开发者则关注工具调用权限、文件系统隔离和代码执行沙箱。如果说长任务和记忆解决的是 "Agent 能不能完成任务 ",那么评测和安全解决的就是 "Agent 能不能被放心使用 "。
最终来看,这三个方向对应了 Agent 从 " 能用 " 走向 " 好用 " 的关键迭代路径:长任务执行能力决定 Agent 能否完成复杂工作,上下文和记忆能力决定 Agent 能否持续参与长期项目,而评测和安全能力决定 Agent 能否被真正部署到生产环境。
这也是 Harness 需要持续优化的核心方向:在模型能力之上,进一步完善 Agent 面向真实世界任务的执行体系。
三、769 份报名记录里,藏着 DeepSeek Harness 内测需要的关键反馈
DeepSeek 官方尚未,也或许不会公布最终的筛选标准和名单。
但从这份报名统计表来看,真正有价值的,是开发者们正在从不同角度探索 Agent 落地应用的路径。
对于 DeepSeek Harness 团队而言,内测名单的意义,或许并不是寻找 " 最热门 " 的项目,而是找到能够在产品迭代过程中,提供有效反馈的开发者。以下几类能力,可能正是一个 Agent 基础设施持续优化所需要的。
首先,是验证模型能力如何转化为执行能力。
DeepSeek Harness 的核心挑战,是让模型能够稳定完成复杂任务。比如名单中,akashic-agent 的作者于 V4 Flash 高思考强度模式运行 TerminalBench2.1,拿到 70.8% 的成绩,是基于 DeepSeek 模型调优 Agent 运行时并给出实测结果的开发者。

其次,是验证 DeepSeek Harness 能否进入真实应用场景。
一个 Agent 基础设施最终能否成功,不只取决于底层技术能力,也取决于它是否真正满足开发者和应用场景的需求。这次报名中,open-design(83k 星)、lobehub(81k 星)、career-ops(63k 星)等高星项目,都已经拥有一定用户基础,并处于 Agent 应用生态的上层。

这些开发者长期面对真实用户和实际工作流,能够帮助 DeepSeek 了解 Harness 在不同场景中的使用需求:哪些能力最重要、哪些环节容易失效、哪些功能需要进一步优化。
对于仍处于探索阶段的 Agent 基础设施来说,这类来自一线应用的反馈,可能比单纯的测试数据更有价值。
此外,Agent 产品化还需要提前发现安全风险。
随着 Agent 获得更强的工具调用和代码执行能力,权限控制、文件隔离、安全边界等问题会越来越重要。报名区中有开发者曾挖掘 Codex、Claude Code、Cursor 等产品漏洞,关注的正是这些 Agent 从 Demo 走向产品时必须面对的问题。
当然,这份名单并非完整样本。由于评论区天然混杂报名、讨论和围观,加上提交格式不统一,部分项目仍存在身份无法确认、仓库失效、描述缺失等问题。
这份统计档案也并不是完全准确,我们在核查过程中发现,有一些开源项目的分类出现了错误,比如我的世界机器人被分到了安全领域,但总体上是可以作为参考的。
同时,很多高星项目的报名也并不是作者本人,有不少是仅提交过 PR 的参与者,并不能完全代表这些 Agent 项目。
结语:一份提前出现的 Agent 工程路线图
DeepSeek Harness 最终会是什么样,目前还没有答案。但这场由内测招募引发的开源项目 " 大摸底 ",却揭露了 Agent 时代的竞争焦点。
769 份报名记录、712 个开源仓库、120 万 Stars 背后,开发者关注的是一个底层的问题:当模型具备越来越强的推理能力后,如何让它稳定、长期、可靠地完成真实任务。
有人在解决长任务执行,让 Agent 不会跑到一半失控;有人在探索记忆和上下文管理,让 Agent 能理解一个持续演进的项目;有人在测试安全边界,确保工具调用和代码执行不会成为风险源。
这些项目未必都会进入 DeepSeek 的内测名单,但它们提前勾勒出了一张未来 Agent 工程演进的路线图。


登录后才可以发布评论哦
打开小程序可以发布评论哦