
在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:" 多模态布局,我们一直在做。对产品来讲,它很重要;对 C 端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们 V4 的后续版本会支持原生的多模态。"
梁文锋也的确做到了。2026 年 8 月 21 日,DeepSeek 上线了 DeepSeek V4 Flash Vision Exp,DeepSeek 官方称,这是一个多模态视觉理解模型。
和 V4 Flash 以及 V4 Pro 不同,DeepSeek V4 Flash Vision Exp 没有技术报告,也没开源,官方只给了一张性能表和几个演示案例。
可 DeepSeek V4 Flash Vision Exp 怎么看都不像是个 " 组件 "。
以往来看,DeepSeek OCR、DeepSeek OCR 2 这样的模型才贴合梁文锋口中 " 组件 " 的定位。这些模型的作用,是把图片以像素形式存在的文字,转换成电脑可以识别的纯文本字符。
因此,相较 DeepSeek OCR 而言,DeepSeek V4 Flash Vision Exp 更像是一个 " 主线 " 模型。
难道梁文锋对多模态的看法改变了?事实可能并非如此。不过有一点可以肯定,那就是梁文锋学会了放低姿态,用产品和用户形成更密切的交流。
梁文锋此前曾说," 通往 AGI 要经过产品这个台阶,但不用花太多精力做 C 端、B 端。" 而随着 DSH 的爆火,发布后不到一个星期,DS 就发布更新,提升了多模态能力。
过去的梁文锋对于产品有一种 " 偏执 ",不完美不发布。DeepSeek V3.2 版本和 DeepSeek V4 预览版之间,相隔足足 4 个半月,如果从 V3 正式发布开始算,仅仅 1 个大版本,就用了 1 年零 4 个月。
现如今不仅更新变快了,还把 DeepSeek V4 Flash Vision Exp 这种实验性质的模型开放给公众,都是在说明梁文锋态度上发生了一些转变。
多模态是 Agent 和推理的入口
如果你是练跑步的,那么你应该给别人看的成绩你跑了多少米用了多少秒,这样别人才知道你到底是快还是慢。但如果你告诉别人的是三分球命中率是多少,那很显然,你想告诉别人的是你有多准。
DeepSeek V4 Flash Vision Exp 也是如此,它想表达的事情,远非是一个展示 DeepSeek 现有的多模态能力那么简单。
明明是一个多模态模型,官方公布的测评里,放的却是一串 Agent 基准。比如 Terminal Bench 2.1 得 83.9,DeepSWE 59.3。

其实在 AI 视觉模型圈里有一套默认的考卷。
一个新视觉模型发布,通常要放的是这几项:MMMU,跨 30 个学科、大学水平的图文理解与推理,考 " 看到图能不能做对题 ";MathVista,考图片里的数学推理;DocVQA,考从扫描文档里找到答案;ChartQA,考读懂图表里的数字和趋势;OCRBench,考最基础的文字识别。
无论是 Qwen-VL、Gemini 还是 GPT-4o,发新版本的时候,展示的都是这套基准。
即便是 DeepSeek V4 Flash Vision Exp 也放了一些多模态侧的基准,然而这些基准也 " 不太正经 ",充满了浓浓的 Agent 味。
Chartography 考的是专业人士读专业图表做决策,ApexBench 是多模态 Agent 基准,Agents ’ Last Exam 是通用 Agent 评测。没有一项是 " 看图答题 ",全是 " 看完图,把事做下去 "。
这张跑分图,本身就是 DeepSeek 的一种暗示。
梁文锋自始至终都认为多模态不是 AGI 的主线,DeepSeek V4 Flash Vision Exp 是 DeepSeek 在 Agent 跟推理这条主线上的一个必然产物,只不过它刚好也是 " 多模态 " 罢了。
DeepSeek V4 Flash Vision Exp 所展现出来的价值观是,多模态从来不是让你 " 看图聊天 ",而是让 Agent 看懂网页截图、读懂图表数据、理解 UI 布局,然后把任务做下去。
多模态不是目的,是手段,是给主线用的插件。DeepSeek 的主线仍然是 Agent 和推理,DeepSeek V4 Flash Vision Exp 所干的事,也不过是强化了产品的推理能力。
虽然 DeepSeek V4 Flash Vision Exp 这个很神秘,但它也并非是一个凭空出现的模型。
4 月 29 日晚,DeepSeek 多模态负责人陈小康(Xiaokang Chen)在 X 平台发文预告,配文 "Now, we see you",宣布 DeepSeek 多模态识图功能开启灰度测试。
第二天,DeepSeek 正式在 GitHub 发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包含 DeepSeek、北京大学、清华大学,属于三方联合研究成果。
然而这篇论文在 5 月 1 日凌晨就被删除,相关官宣推文也消失不见,GitHub 官方仓库直接变为 404 状态,项目彻底无法访问。DeepSeek 全程未发布任何撤稿公告,也没有公开解释原因。
好在,社区留下了这篇论文的拷贝版本。
这篇论文没有去讲 " 我们模型看得多清楚 ",而是提出一个问题:模型能看见,但不一定能想清楚。
传统多模态模型用自然语言描述图片里的对象,比如 " 左边那个男的 "" 右边那个高的 "。可是在复杂场景里,这种描述非常模糊,模型很容易越推越乱,最后导致整个逻辑崩塌。
就拿集体照来说,左边一共好几个男的,那么哪个男的才是模型所描述的那个?
DeepSeek 的解法,是把点坐标和边界框提升为 " 思维的最小单元 ",直接嵌进推理链,让模型 " 边推理边指向 ",就像人数东西时会伸出手指,一个一个点着数。
靠这套机制,模型在计数、空间推理、迷宫导航这类任务上,把抽象的判断精确锚定到图像坐标,从 " 左边那个男的 "、" 右边那个高的 ",变成了 " 我手指的这个 "、" 我手指的那个 "。
6 月,经过 DeepSeek 官方确认,其在客户端和网页端上线的 Vision 模式,底层就是这套视觉原语机制。
而 DeepSeek V4 Flash Vision Exp,是把同一套技术嫁接到了 V4-Flash 的 API 基座上,重点强化多模态 Agent 能力,核心推理逻辑完全沿用了论文的方案,没有跳出其技术框架。
不仅如此,论文当时的实验,就是基于 DeepSeek-V4-Flash 作为语言骨干所搭建的多模态方案。这次的 DeepSeek V4 Flash Vision Exp 光看名字也知道,仍然使用的是 DeepSeek-V4-Flash。
除了 DeepSeek V4 Flash Vision Exp 这个模型,DeepSeek 在多模态方面的进展还体现在 DSH 上,8 月 19 日晚,作为 DeepSeek 目前的主力产品,DSH 更新了 rc.8 版本,提升了 Agent 的多模态能力。
rc.8 的核心,是 DeepSeek 在多模态这件事上," 两条腿 " 走路。
一条叫 " 原生直通 "。rc.8 给模型适配器加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如 GLM、Qwen,或者刚上线的 V4-Flash-Vision-Exp,Harness 就把图片原封不动送进模型,不做任何中间加工。
另一条叫 " 工具层视觉 ",服务的是纯文本模型。
比如用 DeepSeek 自己的 V4-Flash,直接读图会失败。这时 Harness 不会报错退出,而是自动降级成一套工具链,先做 OCR 识别文字,再统计图片颜色比例、扫描部分像素行、读取尺寸和颜色模式,把这些信息拆成结构化证据,最后交给文本模型去推理整张图。
Cherry Studio 的核心创始人 Yinsen 把这种方式称为 " 伪视觉 ",对付 PPT 截图、流程图、界面这类结构清晰的图够用,面对真实照片和复杂的空间关系就很勉强。
但要说明的一点是,DSH 在 rc.8 之前,甚至连 " 伪视觉 " 都没有,全靠社区的视觉插件,还有通过 pi2dsh 桥接进来的视觉方案。
它们的做法大同小异,先调一个外部的视觉模型(比如 GLM、Qwen)把图片识别成文字,再把结果塞回文本模型。
这些插件证明了 DSH 架构的开放性,也同时暴露了一件事,DeepSeek 自己没有视觉模型,只能借别人的眼睛。
DSH 还有哪些可以补足?
正如开头提到的,虽说梁文锋没有改变旧观点,但梁文锋也学会放低了姿态。
2025 年,在 DeepSeek R1 惊艳全球之后,社区就开始等待 DeepSeek 发布 V4。
2025 年下半年,随着 V3.1、V3.2 等迭代版本陆续推出,无数媒体 " 独家爆料 ",称 DeepSeek 下一代旗舰大模型 V4,计划于 2025 年 7 月、8 月、9 月……直至 2025 年年底发布。
结果自然是无一准确,堪称现代版狼来了。
2026 年春节前,距离 V3 发布已经过去 400 多天,所有人都在赌 DeepSeek 会复刻春节档 R1 的奇迹,把 V4 卡在农历新年这个节庆日子上线。
结果 2 月 4 日,外媒援引消息人士的话,称春节期间 V4 不会发布,DeepSeek 官方也对此事保持沉默。
然后时间线一路后移。最后到了 4 月 24 日,V4 才以预览版的形式登场,一次同时放出了 V4-Pro 和 V4-Flash。
梁文锋的产品观是,宁可跳票,也不肯在产品没有完全做好的前提下发布。
可也就是在这段时间里,DeepSeek" 掉队 " 了。
国际方面,2025 年 8 月,OpenAI 发布了 GPT-5;11 月,Anthropic 发布 Opus 4.5。这两款模型都是问鼎全球的性能榜的产品。
而在国内,2025 年 4 月 Qwen 3,不到半年后,阿里一口气放出来了 Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。还有 Kimi 的首个原生多模态模型 K2.5、智谱的 GLM-4.7、MiniMax 的 M2.1、腾讯的 hunyuan world 等等,数不胜数。
与之相对的,DeepSeek 发布的产品只有 V3.1(8 月 V3.1,9 月 V3.1-terminus)和 V3.2(12 月)。
除了 DeepSeek,全世界都在以月为单位发布模型,Anthropic 更是以天为单位,在 2026 年 2 月 1 日到 3 月末,52 天的时间里发布了 73 款功能和产品。
假如梁文锋是大厂的产品经理,以他发产品的效率,恐怕撑不过试用期就得被开除。只可惜 DeepSeek 是他的。
6 月 29 日,DeepSeek 给全体 API 开发者发邮件,明确表示 V4 正式版 7 月中旬上线。7 月 21 日,有消息表示正式版将要延期,目标挪到 7 月底。7 月 28 日,又有消息说可能拖到 8 月 10 日至 20 日之间。
7 月 31 日,V4-Flash 正式版才千呼万唤始出来,而 V4-Pro 正式版,直到 8 月 12 日晚间才正式上线。
梁文锋对待产品,不做到自己满意,绝对不放出来。
可到了 DeepSeek V4 Flash Vision Exp 这里,明显味道变了。
模型上线当晚,社区就开始对其进行检测。根据实测显示,DeepSeek V4 Flash Vision Exp 连梁文锋本人最具代表性的一张照片都无法识别。

不仅如此,还有用户反馈,称 DeepSeek V4 Flash Vision Exp 在理解复杂图表时会漏掉关键信息,中文场景的处理偏弱,有人在对话里插入图片后,还发现上下文缓存机制受到牵连。
一圈看下来,社区对 DeepSeek V4 Flash Vision Exp 的普遍看法是 " 效果好像也就那样 "。
这个模型就像是在餐馆等着上菜,看不见后厨,不知道这盘菜什么时候才能端上来,厨师怕你等不及,于是从锅里盛了一勺给你尝尝,告诉你说菜还没做好,但是在做了。
其中的原因,很可能在于梁文锋持续受到优秀产品的压力。DSH 从立项之初就对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。
8 月 23 日,外媒报道称 Anthropic 或将于 8 月底递表上市,因此目前正处于静默期,Claude Code 没有较大的更新。
OpenAI 却很激进,8 月 20 日直接开源了 Codex Harness,这是支撑 Codex 运行的底层系统。负责把模型和工具接起来,让模型能打开文件、执行命令、记住任务进行到哪一步,以及遇到有风险的操作要停下来询问。
但这并不是重点,重点是,在产品逻辑上,Codex Harness 把多模态放在了 Agent 运行时的核心位置。
在 Codex 的工作流里,图片不是先交给某个外部视觉模型,再把识别结果转述给文本模型。
模型是可以直接接收截图、界面和其他视觉输入的,并把这些内容纳入同一条任务链。模型会先理解画面,再决定要调用什么工具、修改哪些文件、运行哪些命令,最后根据执行结果继续修正。
正如前文所述,DSH 无论是哪条腿,在多模态这件事上,在 DeepSeek V4 Flash Vision Exp 之前,它都是割裂开的。DSH 只负责以 " 模型处理过的图片 " 进行推理,而非用图片进行推理。
显然,Codex 效果更强,首先是因为它减少了一次信息损耗。图片经过 OCR 或摘要之后,模型看到的已经不是原始画面,而是工具挑选出来的文字和特征。
只要处理过的图片漏掉一些信息,那么后面的推理就只能建立在不完整的证据上。
举个例子,前面的话就相当于模型处理后的图片,后面那句话是原图。你会发现,仅仅只漏掉一个字,意思就完全相反了。
要断章取义——出自 " 不要断章取义 "
原生视觉输入则让模型直接面对图像,文字、布局、位置和相互关系可以在同一上下文里被判断。
其次,Codex 把视觉理解和行动闭环连在了一起。它不是单独回答 " 这张图里有什么 ",而是要根据截图判断下一步该做什么,再通过终端、文件和其他工具验证结果。
就算是中间出错了,新的截图和执行反馈还能继续回到同一条推理链里。这样一来,多模态就不再是 " 识别完了就完了,后面发生啥不关我事 " 的状态了,而是一个持续的服务,以提高推理的性能。
而这一步也是目前 DSH 所欠缺的。
所以这也是为什么 OpenAI 在开源 Codex Harness 后,DeepSeek 会立马开源 DeepSeek V4 Flash Vision Exp,梁文锋是想告诉用户,别急,别人有的我们也有,不过需要一点时间。
社区正在补足 DSH 的最后一公里
当然,DSH 最明显的短板,是它和普通用户之间距离太远了,没点计算机知识,估计连 DSH 怎么安装都不清楚。
好在的是,正是由于 DSH 开源,所以这最后一公里,社区已经开始接手了。
最典型的例子是 DSH Desktop,这个项目由一位 06 年的大二学生 Benson Wang 开发。
它的核心就四个大字 " 一键安装 "。把原本需要复杂安装环境,以及输入 npm 指令才能安装使用的 DSH,变成一个 exe,下载以后双击安装就能直接变成一个桌面工具。
然而就是这么简单的一个项目,短短几天,就在 GitHub 上获得了 1.8 万颗星星。可见,大家普遍都认为 DSH 就该有一个简单方便的桌面版本,现在的 DSH 确实有些 " 反人类 " 了。
顺便一提,DSH Desktop 这个项目的贡献者也有 DSH 负责人崔添翼,不过这并不是说明他参与了开发,而是 GitHub 本身的开源协作机制,让 DSH 原本的贡献者出现在了这里。

Benson Wang 表示,他正在开发手机版的 DSH,项目名为 anywhere DSH。
他计划通过 iOS 和 Android 连接桌面端,让用户在手机上发起任务、查看 Agent 进度,并在需要时继续跟进。
这也是社区最有价值的地方。
事实上,DSH 官方团队本身也非常关注社区。比如他们关注了 DSH-better-sidebar 这个项目,这是 DSH 第三方社区 UI 增强插件,给 DSH 原生 Web 界面提供了一套完整的服务化侧边栏工作台框架。以及 awesome-dsh-plugins,提供 DSH 插件精选和搜索雷达,相当于是一个 DSH 的插件市场。
或许不久的将来,DSH 会 " 收编 " 这些优秀的项目和开发者,丰富现在的 DSH。
诚然,社区项目不能自动等同于 DeepSeek 的战略转向。开放生态越是发展,就越是会有版本兼容、权限控制、插件安全等问题出现。
但官方的态度就说明,DSH 正在通过社区吸纳好的想法。
或许不久的将来,DSH 也将上线官方的插件市场,想用什么插件,自己直接在官方的入口里搜就行了。


登录后才可以发布评论哦
打开小程序可以发布评论哦