AI时代前沿 22小时前
DeepSeek开源AI模型与智能体之间缺失的那一层
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

AI 模型正在以惊人的速度进化。它们如今在推理、编程和解决长程问题方面的能力都超越了以往任何时候。

然而,一个智能体(agent)需要的不仅仅是一个优秀的大脑。它必须记得五步之前发生了什么。它必须调用正确的工具、处理文件并与外部系统协作,并且真正地将答案付诸行动。然后,它还必须将所有这些过程记录下来。

深度求索(DeepSeek)一直在研究这个问题,上周,它开源了其中的部分技术架构。

Harness是该公司推出的全新开源框架,专为构建智能体而设计。有意思的是,DeepSeek 几乎没有坚持要掌控多少东西——模型可以替换,工具是插件式的,存储和沙箱也是如此,开发者可能想要替换或修改的其他组件同样如此。

它更像是一套智能体构建工具包,而非一个成品智能体。

如果你对去年初的 DeepSeek 还有印象,就会知道这并非这家中国 AI 实验室第一次突然站到 AI 话题的中心。去年初,DeepSeek 的模型一出场,其性能就令业内大跌眼镜——尤其是考虑到其背后的经济学水平。

当时的反响远远超出了 AI 圈。诚然,也存在一些质疑声,但炒作热度丝毫不减。市场震荡,芯片股受挫,行业观察家开始怀疑,源源不断投入 AI 模型的资金是否真的物有所值。几乎一夜之间,DeepSeek 从一家相对陌生的中国实验室,变成了整个行业都在关注的公司。

如今,DeepSeek 带着一个截然不同的命题回来了。这一次,Harness 的核心不再是夺人眼球的新型基础模型。事实上,模型被刻意设定为只是其中的一部分。DeepSeek 推出的,是模型周围的那一层——一套决定 AI 智能体能否真正完成任务的软件集合。

这次发布也有一些实打实的数据支撑。与 Harness 一同亮相的还有DeepSeek V4-Pro-0813,这是该公司旗舰模型的最新版本,本次的关注点很大程度上落在了其智能体能力上。

DeepSeek 给出的 V4-Pro-0813 成绩如下:

Terminal Bench 2.1:87.9 分

Toolathlon-Verified:74.1 分

DSBench-FullStack:71.1 分

当然,这些都是 DeepSeek 自己的基准测试结果。但有一个细节让它们在此处尤为重要:在一些公开的编程智能体测试中,V4-Pro 正是在 Harness 的最小模式下运行的

所以,Harness 不只是 DeepSeek 随模型一起发布的附属品——它已经是该公司测试模型智能体能力的一部分。

仍在早期,但已可上手

Harness 还相当粗糙。DeepSeek 称之为 " 开发者预览版 "。值得注意的是,该公司以MIT 许可证发布了代码——这赋予了企业相当大的自由度,可以修改 Harness 并将其用于商业产品中,而无需开放自己的代码。

该公司也相当直白地警告开发者:未来将会出现破坏兼容性的变更。具体何时发生,目前尚未透露细节。

不过,就目前而言,已经有不少功能可以探索:

Harness 可以打开代码仓库、编辑文件、执行 Shell 命令;

支持网络搜索、制定可执行计划、将任务的不同部分分发给其他智能体;

具备步骤记录能力:工具调用、结果和模型交互都会随会话一起保存,开发者可以事后回溯发生了什么;

旧会话可以重新拾起,也可以从更早的节点拆分出去——当智能体运行了一段时间后突然走偏时,这个功能非常有用;

你其实不需要搭配 DeepSeek 的模型来使用 Harness。模型也是插件。这让 DeepSeek 处于一个略显不同寻常的位置:它发布的智能体框架,里面可以轻松装上竞争对手的模型。

对于一家以模型引发轰动而闻名的公司来说,这是一次相当大的方向转变。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论