刚哥白话 08-16
DeepSeek 还在“瞎干”?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大家好,我是刚哥!

最近 AI 圈很热,Kimi K3、阿里 Qwen 3.8、智谱 GLM 5.3、DeepSeek V4 等国产旗舰模型陆续发布,跑分和促销价格都很吸引人。

我现在写文章做项目,基本都用 Claude Code 和 Codex,但网络、支付问题一直是麻烦。如果国产模型能够替代它们,当然是件好事。所以 DeepSeek V4 发布后,我第一时间决定试一试。

不过,一用才发现,现在宣传的口径就像 " 皇帝的新衣秀 " 一样。

宣传只挑好的说,存在的问题却一点不讲。下面我结合真实体验,说清楚 DeepSeek V4 的亮点、缺陷,以及它究竟适合什么场景。

【全文 2605 字,阅读 10 分钟】

01 DeepSeek 还在瞎干?

DeepSeek 最大的优势,一直是不错的推理能力、亲民的价格和开源路线。

虽然很多人诟病 DeepSeek V4 涨价,但模型能力升级必然伴随研发和算力成本上升,贵一点并非不能接受。

这次 DeepSeek 推出了两套产品:

包含旗舰大模型 "DeepSeek V4 PRO",高性能、低成本的 DeepSeek V4 Flash;

又被称为 DSH,是 DeepSeek 开源的首款 Agent 框架,定位是 " 一切皆插件的模型执行引擎 ",对标 OpenAI Codex / Claude Code,主攻编程和办公场景,让 V4 模型从 " 能聊 " 变成 " 能干 "。

因此,我首先下载了 harness,然后开始试用。

我先让 DeepSeek V4 开发了几个页面、画了几张架构图。效果不错,输出基本符合预期。

但当我上传截图,准备调整几个界面细节时,它却弹出了 " 当前模型不支持图片,请切换支持图片的模型。"(见图 1)

图 1:DeepSeek 不支持图片输入

真没想到,DeepSeek V4 Pro 这样的旗舰版至今还没支持 " 多模态输入 "。

这就像在 " 智能手机 " 时代还在用 " 功能机 "。

这究竟是我的要求太高,还是旗舰模型的普遍现象?为此,我调研了主流模型的编程能力、多模态能力和价格。

1、多模态不是标配吗?

我查了一下国内外主流旗舰模型,不支持多模态输入的仅有 DeepSeek 和智谱 GLM。

图 2:旗舰大模型多模态支持情况

其他模型不仅支持图片,做得好的还支持文档、音频、视频甚至桌面 GUI;OpenAI 的 GPT 还支持图像输出,可以直接辅助图表设计。

对于一款旗舰模型来说,多模态输入显然已经是标配。

2、编程不需要多模态吗?

这次我查了一下这几个模型的第三方跑分情况。这里我选了国际上权威的独立测评机构—— Artificial Analysis 的 AA 综合测评指数。

AA 指标的权威性在于,它不依赖于厂商自己报的数据,而是采用统一的 9 个公开标准,对大模型进行评测。最关键的,它只测文本智能,不测多模态。

图 3:大模型 AA 跑分与多模态横向比较

DeepSeek 和 GLM 虽然排进了 Top 10,但与 Claude、GPT、Kimi K3 相差 7~10 分,与 Qwen 3.8 也有明显差距;它们只领先了同样主打性价比的 MiniMax。

也就是说,牺牲多模态,并没有换来更强的文本智能。

3、价格真的很便宜吗?

既然功能和模型能力都没有形成明显优势,DeepSeek 最后能守住的就只剩价格。毕竟不做多模态,可以省掉图像标注、视觉编码、图像审核以及相应的算力成本。

图 4:DeepSeek 便宜吗?

从图 4 可以看到,DeepSeek 采用高峰、低谷两档价格,相差约 2 倍,整体与智谱 GLM 接近;真正更有性价比的,反而是支持多模态的 MiniMax M3。

据说支持多模态的 DeepSeek 模型正在进行灰度测试,价格也没有公布。但是,如果模型能力没有太多提升的话,价格超过 Qwen 3.8 是说不过去的。

02 DeepSeek 该怎么用?

说到这里,DeepSeek V4 的定位已经很清楚:它像一个 " 比较聪明的瞎子 ",闭着眼输出又快又便宜,但要靠视觉理解环境、自主完成任务,就容易抓瞎。

图 5:DeepSeek 使用场景

DeepSeek 适合纯代码开发、修改 Bug、批量任务和长上下文处理;

但它不适合依赖视觉反馈的 Vibe Coding、自动化测试、桌面和浏览器操作,更不用说视频剪辑和音频处理。

所以,用户如果需要 Vibe Coding、复杂的可视化自动任务,需要再等等。现在的 DeepSeek V4 并不适合你。

03 Harness 太牛了

这次发布真正的亮点,可能不是 V4 本身,而是开源智能体框架 DeepSeek Harness(DSH)。它基于 Cordis,采用 " 一切皆插件 " 的架构理念。

它就像 Agent 时代的乐高积木:官方插件、社区插件和自研插件都能自由拼装。

1、DeepSeek Harness 是什么?

DeepSeek Harness(简称 dsh),它就像驾驭大模型的一套马鞍(Harness),DeepSeek V4 决定了这匹马聪不聪明,Harness 则用来操控这匹马如何更好地工作。

DeepSeek 官方的定义公式非常简单:

Agent = Harness + Model

从图 6 可以看到,Harness 负责处理上下文和执行流程,Model 负责思考,两者共同组成一个既会想、又能持续干活的 Agent。

图 6:DSH 是一套智能体框架 2、一切皆可插件

为了推广 " 一切皆插件 " 的理念,DeepSeek 官方设立了 "DeepSeek Harness 开发者预览版 " 网站(见图 7)。

图 7:DeepSeek Harness 开发者预览版网站

网站提供开源框架、开发者文档和社区插件。开发者可以下载源码,在本地运行并二次开发。

https://deepseek.com/harness/

下面我来逐一介绍一下。

1)开源框架

Harness 上线两天就突破 10 万 Star,原因之一,是它为 Codex、Claude Code、WorkBuddy、Qoder Work 等商业 Agent 工具提供了一个开源替代方案。

https://github.com/deepseek-ai/deepseek-harness

2)插件内核

初期的 DeepSeek Harness 看上去很简陋,甚至像个半成品,但 Cordis 插件内核给它留下了很大的扩展空间。

插件化的好处在于,界面主题、提示词、MCP/Skill/ 文件工具等,你都可以像乐高积木一样任意替换和组装,而不必重新搭建整套 Agent。

3)社区生态

即使不懂开发,也可以直接使用社区插件。目前已经有 3000 多个插件分享到社区。

图 8:DSH 插件社区

用户只需要一个命令,就能把插件安装到自己的 dsh 中运行。DeepSeek 也由此把开源贡献者变成生态建设者,这是闭源商业软件很难用钱直接买来的能力。

04 讲在最后

这次 DeepSeek V4 发布,槽点和亮点都很鲜明。

1、DeepSeek 斩杀线

V4 并不像宣传中那么全面,与全球顶尖模型的差距主要体现在三点。

1)模型能力的代差

文本智能与全球顶尖模型仍有差距,仅与 GPT 5.6 Luna 这类低档型号相当。

2)应用场景的狭窄

不支持多模态,使它主要局限在纯文本开发和文件处理,无法进行可视化的 Vibe Coding、自动化测试、桌面操作、视频编辑。

据说 DeepSeek 多模态版本正在灰度测试当中,希望尽快能推出来,弥补这方面的短板。

3)主打量大管饱

虽然涨价超过 50%,DeepSeek V4 依然相对亲民。它不追求面面俱到,但对大量文本和简单长任务来说,仍然 " 量大管饱 "。

它不是能力最强的旗舰模型,却把 " 旗舰模型最低应该做到什么程度 " 摆在了这里。

DeepSeek V4 就是一个旗舰大模型的斩杀线。

如果一款旗舰模型在性能、功能和价格上都无法超过 DeepSeek,就很难继续留在旗舰竞争中。

2、DeepSeek 夯爆点

瑕不掩瑜,DeepSeek Harness 用开源和插件化,为用户提供了商业 Agent 工具之外的另一种选择,也让开发者可以共同扩展它的能力边界。

所以,这次 DeepSeek 真正值得关注的,不只是一个 " 又快又便宜 " 的 V4,而是它正在用开源 Harness,把模型能力变成一套可以不断扩展的 Agent 生态。

最后,如果大家感兴趣的话,我会找时间把 DeepSeek Harness,如何使用以及如何进行插件的二次开发,给大家单独做个分享。

以下是我支付和 AI 的交流群,进去的同学可以添加入群,一起交流。

【AI+ 支付交流群,请注明来源公众号】

特别说明:本人不介绍通道,欢迎商业合作

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

智能手机 kimi 编程 开源 阅读
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论