智东西 7小时前
昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 江宇

编辑 | 李水青

智东西 8 月 20 日报道,昨夜,DeepSeek Harness 迎来公测后的首次重要更新。DeepSeek Harness v0.1.0-rc.8 版本上线多模态能力成为这次更新的重头戏。

此次更新共带来14 项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补齐了 Agent 处理图片等多模态任务的能力,也进一步完善了子代理协作、终端交互和工具调用体验。

新版支持原生图片请求和图文混合输入,/goal、/plan 等命令也可以直接接收图片;与此同时,Claude Code、Codex 进一步接入其子代理体系Windows 终端体验以及图片请求、流式生成、自定义网关等一批问题也得到修复。

DeepSeek Harness 于 8 月 13 日正式开启 v0.1 版本公测并同步开源。公测当晚,智东西曾第一时间拉取源码进行实测,用它完成 88 页论文翻译、贪吃蛇游戏开发等任务。

仅过去不到一周,这套 Agent Harness 又把多模态补上了。这次更新很快引起了 DeepSeek Harness 社区讨论。

有国内开发者看到更新后直接感叹:"DSH 支持多模态了,奔走相告!"

海外开发者同样把注意力放在这两项能力上。有网友评价称,DeepSeek Harness 正变得 " 越来越有意思 ",多模态支持和更完善的子代理集成是一次明显推进。

更有意思的是,有开发者进一步扒出了 DeepSeek Harness 的 " 看图 " 方式:面对本身不支持图像输入的模型,它还能调用 OCR、颜色统计、像素扫描等工具,把图片拆成结构化信息后再交给文本模型推理,相当于给纯文本模型拼出一套工具层的 " 视觉 "。

GitHub:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8

一、多模态正式补齐,直接 " 看图 "

rc.8 最明显的变化,就是 DeepSeek Harness 进一步补齐了多模态输入。

根据官方更新日志,DeepSeek 模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness 可以直接把图片送进模型;/goal、/plan 等指令也已经支持图文混合输入。

同时,输入框中的@菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。

这意味着,过去主要围绕文本、代码和工具调用展开的 Agent 工作流,现在可以进一步把截图、图片等视觉信息纳入任务上下文。

子代理体系也继续扩充。

新版支持把 Claude Code 和 Codex 作为 Profile Bundle 按需安装。其中,Codex 支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同 Codex 子代理。

Windows 用户这次也被重点照顾。DeepSeek Harness 的 PTY 终端加入持久 PowerShell 会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。

除了新能力,这次更新还集中修掉了一批公测后暴露的问题。

比如,当单张图片尺寸过大,或者历史会话中累积图片过多时,此前可能导致模型请求直接失败;新版对此进行了处理。

取消一次流式生成后,已经显示出来的回复前缀此前也可能不会被带入下一轮提问或者分叉会话,这一问题目前已经修正。

对于使用自定义 OpenAI 兼容网关的开发者,新版还修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。

二、纯文本模型也能 " 看图 ",OCR 和像素分析拼出工具层视觉

DeepSeek Harness 补上原生图片请求之外,一个有意思的细节很快被开发者扒了出来。

网友 Yinsen 测试 DeepSeek Harness 处理图片时发现,当所调用的模型本身没有声明图像输入能力,直接调用 read_image 会首先失败。

但任务并没有就此停下。从其展示的执行轨迹来看,Harness 随后会退化到另一套工具链:先进行 OCR 文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。

例如,一张包含文字和简单图形的图片,可以被拆成 " 文字内容及坐标 "" 背景颜色比例 "" 特定区域像素变化 "" 图片尺寸 " 等多组信息。

最后,这些结构化结果会被重新交给文本大模型,让模型根据 OCR 文本、颜色占比、像素位置等证据 " 脑补 " 出整张图的大致内容。

因此,这种能力和视觉大模型直接理解图片仍然有明显区别。对于 PPT 截图、流程图、界面截图等结构相对明确的图片,它可以借助 OCR 和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,这种工具链能够恢复的信息则会受到明显限制。

但从 Agent Harness 的角度看,这个设计颇有意思:视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。

事实上,在官方加强多模态支持之前,DeepSeek Harness 社区已经围绕视觉能力出现了一批插件,包括 dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision 以及通过 pi2dsh 桥接的 pi-vision 等。

其中一些方案就是通过 OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置 input: [ text, image ] ,直接接收图片。

rc.8 上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。

三、上线不到一周加速迭代,盯上了多模态和子代理

8 月 13 日公测时,DeepSeek Harness 团队就强调,其核心设计思路是 " 一切皆插件 ":模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力,都可以由不同插件组合和替换。当 Agent Harness 拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。

此次 rc.8 又继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code 和 Codex 则可以作为子代理按需装进同一套 Harness 中。

除了这些核心变化,rc.8 还加入了 web_search 并发查询、子代理 reportDelivery 及时唤醒父任务、本地运行 dsh web 自动打开浏览器等优化,并提升了大型历史会话分叉以及 SQLite 后端的读写性能。

结语:一切皆插件,把模型能力 " 拆开重组 "

从 8 月 14 日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness 仍处于快速迭代阶段。

接下来值得期待的,是这套插件化 Harness 能否继续把更多模型、工具和 Agent 装进同一个体系,并跑出更复杂、更稳定的任务流程。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

贪吃蛇 windows 智东西 翻译 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论