
作者 | 江宇
编辑 | 李水青
智东西 8 月 20 日报道,昨夜,DeepSeek Harness 迎来公测后的首次重要更新。DeepSeek Harness v0.1.0-rc.8 版本上线,多模态能力成为这次更新的重头戏。
此次更新共带来14 项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补齐了 Agent 处理图片等多模态任务的能力,也进一步完善了子代理协作、终端交互和工具调用体验。

DeepSeek Harness 于 8 月 13 日正式开启 v0.1 版本公测并同步开源。公测当晚,智东西曾第一时间拉取源码进行实测,用它完成 88 页论文翻译、贪吃蛇游戏开发等任务。
仅过去不到一周,这套 Agent Harness 又把多模态补上了。这次更新很快引起了 DeepSeek Harness 社区讨论。
有国内开发者看到更新后直接感叹:"DSH 支持多模态了,奔走相告!"


GitHub:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8
一、多模态正式补齐,直接 " 看图 "
rc.8 最明显的变化,就是 DeepSeek Harness 进一步补齐了多模态输入。
根据官方更新日志,DeepSeek 模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness 可以直接把图片送进模型;/goal、/plan 等指令也已经支持图文混合输入。
同时,输入框中的@菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。
这意味着,过去主要围绕文本、代码和工具调用展开的 Agent 工作流,现在可以进一步把截图、图片等视觉信息纳入任务上下文。
子代理体系也继续扩充。
新版支持把 Claude Code 和 Codex 作为 Profile Bundle 按需安装。其中,Codex 支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同 Codex 子代理。
Windows 用户这次也被重点照顾。DeepSeek Harness 的 PTY 终端加入持久 PowerShell 会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。
除了新能力,这次更新还集中修掉了一批公测后暴露的问题。
比如,当单张图片尺寸过大,或者历史会话中累积图片过多时,此前可能导致模型请求直接失败;新版对此进行了处理。
取消一次流式生成后,已经显示出来的回复前缀此前也可能不会被带入下一轮提问或者分叉会话,这一问题目前已经修正。
对于使用自定义 OpenAI 兼容网关的开发者,新版还修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。
二、纯文本模型也能 " 看图 ",OCR 和像素分析拼出工具层视觉
DeepSeek Harness 补上原生图片请求之外,一个有意思的细节很快被开发者扒了出来。
网友 Yinsen 测试 DeepSeek Harness 处理图片时发现,当所调用的模型本身没有声明图像输入能力,直接调用 read_image 会首先失败。

例如,一张包含文字和简单图形的图片,可以被拆成 " 文字内容及坐标 "" 背景颜色比例 "" 特定区域像素变化 "" 图片尺寸 " 等多组信息。
最后,这些结构化结果会被重新交给文本大模型,让模型根据 OCR 文本、颜色占比、像素位置等证据 " 脑补 " 出整张图的大致内容。
因此,这种能力和视觉大模型直接理解图片仍然有明显区别。对于 PPT 截图、流程图、界面截图等结构相对明确的图片,它可以借助 OCR 和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,这种工具链能够恢复的信息则会受到明显限制。
但从 Agent Harness 的角度看,这个设计颇有意思:视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。
事实上,在官方加强多模态支持之前,DeepSeek Harness 社区已经围绕视觉能力出现了一批插件,包括 dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision 以及通过 pi2dsh 桥接的 pi-vision 等。
其中一些方案就是通过 OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置 input: [ text, image ] ,直接接收图片。
rc.8 上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。
三、上线不到一周加速迭代,盯上了多模态和子代理
8 月 13 日公测时,DeepSeek Harness 团队就强调,其核心设计思路是 " 一切皆插件 ":模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力,都可以由不同插件组合和替换。当 Agent Harness 拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。
此次 rc.8 又继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code 和 Codex 则可以作为子代理按需装进同一套 Harness 中。
除了这些核心变化,rc.8 还加入了 web_search 并发查询、子代理 reportDelivery 及时唤醒父任务、本地运行 dsh web 自动打开浏览器等优化,并提升了大型历史会话分叉以及 SQLite 后端的读写性能。
结语:一切皆插件,把模型能力 " 拆开重组 "
从 8 月 14 日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness 仍处于快速迭代阶段。
接下来值得期待的,是这套插件化 Harness 能否继续把更多模型、工具和 Agent 装进同一个体系,并跑出更复杂、更稳定的任务流程。


登录后才可以发布评论哦
打开小程序可以发布评论哦