

作者|周末
原创首发|蓝字计划
鲸鱼还是 " 开眼 " 了。
经过四个月的千呼万唤,DeepSeek 终于补上多模态能力,推出了全新的视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。

图源:DeepSeek 官方账号
梁文锋滑动变阻器,也向着 " 梁圣 " 的方向又拨动了一格。
相比 V4 Flash,Vision-Exp 最大的变化,就是原生支持图片输入,终于可以直接认人、读截图、看图表。
价格方面,也还是熟悉的 DeepSeek 风格。一张图片最多只会折算成 384 个输入 Token,即使按照高峰期价格计算,只需要花一分钱,就可以请它帮忙看 8 张图,看看图里都有什么。
终于补上了 DeepSeek 长久以往的一块短板,价格又依旧是 " 梁心 " 价,外界对 DeepSeek 这双刚装上的 " 眼睛 " 自然期待拉满。
只是,如果只看网上的口碑,不少用户实测之后,留下的评价却只有四个字:
" 效果一般 "。

跑分很美,评价一般
不知道梁文锋上不上知乎,但当我刷到一个叫做《怎么评价 DeepSeek-V4-Flash-Vision-Exp 发布,多模态能力表现如何?》的帖子时,我只想对梁文锋说:
恶评,别看!

知乎网友发文
帖子下面,一个拿到 1366 个赞的回答先说:" 她不一样,她是一个好模型。"
随后话锋一转,又给 Vision-Exp 安排了一个 " 好赌的爹 "、一个 " 生病的妈 " 和一个 " 上学的弟 ",最后得出结论:" 所以她破碎是可以原谅的。"
这条回答其实没有直接说 Vision-Exp 不好,甚至先夸它是个 " 好模型 "。可从 " 好赌的爹 " 到 " 破碎也可以原谅 ",怎么看都不太像是在夸奖。
这样的评价,和这款模型的官方跑分其实挺割裂。
官方数据显示,Vision-Exp 基本保留了 V4-Flash 原有的 Agent、推理和世界知识能力。在需要视觉理解的 Agent Benchmark 上,它的多模态 Agent 成绩已经接近 Anthropic 的头牌 Opus 4.8。

跑分都快摸到 A 社头牌了,怎么到了网友手里,就 " 破碎 "?
这就不得不提几个最有节目效果的网友实测了。最先翻车的,是最简单也最有节目效果的认人。
有人把梁文锋的照片发给 Vision-Exp,问它 " 这是谁 "。结果 DeepSeek 盯着自己的 " 老爸 " 看了 6 秒,十分肯定地回答:这是美团创始人王兴。
换了一张照片再问,它又把梁文锋认成了字节跳动创始人张一鸣。

网友实测 Vision-Exp
王兴和张一鸣:人在家里坐,锅从天上来 ......
认一个人都不行了,那要是一张多人的合照呢?
有网友把时代少年团的合照交给 Vision-Exp,让它说出五个人的名字。DeepSeek 这次倒是谨慎了很多,一个名字也没敢猜,最后却得出了一个更加离谱的结论:
照片里五个人长得太像,皮肤过于光滑,连手里的提包都有 "AI 感 ",所以这很可能是一张批量生成的假图,里面根本没有真人。
别说认出时代少年团了,它甚至开始怀疑时代少年团到底是不是真人。

网友实测 Vision-Exp
由此可见,DeepSeek-V4-Flash-Vision-Exp 在认人这一块,目前还是个 " 睁眼瞎 "。
不过,识人说到底只是娱乐局。但坏消息是,哪怕换成更接近开发者工作的复杂任务,Vision-Exp 的问题也没有完全消失。
还有网友要求它生成一个 Three.js 三维场景。最终成品的完整度虽然略优于 Gemini 3.7 Flash,但在执行过程中,Vision-Exp 反复自我纠错,还出现了多次断联。完成同一个任务,它消耗的 Token 高出近 15 倍,耗时也多出 3.5 倍。

网友实测 Vision-Exp
只能说,就算跑分里已经摸到了顶级模型,落到真实任务里,Vision-Exp 还是处处透着实验版的痕迹。
不过纸上得来终觉浅,网上的测试多少会受到图片质量和提示词影响。
Vision-Exp 到底是不是真的这么拉,恰好 DeepSeek Harness 也在这时候支持了原生图片请求,我们赶紧自己测了一轮。

鲸鱼的大眼睛,还得练
我们的测试,先从网上翻车率最高,也最有节目效果的识人开始。
不过,这次我们没有单独拿一张人物照片考它,而是给了 Vision-Exp 一张 AI 合成的梗图。

梁文峰、马斯克和奥尔特曼
画面把梁文锋、马斯克和奥尔特曼等一众硅谷大佬放到了一起,身后竖起来的,是一个带有 DeepSeek Logo 的白旗。
实际上,这个构图的出处可是大有来头,它复现的是 2024 年 7 月特朗普在宾夕法尼亚州巴特勒遭枪击后,被特勤人员护送时高举拳头的名场面。
所以,这个测试丢给 DeepSeek ,就不只是看模型能不能识别人。它还得弄清楚三个人为什么会出现在同一张图里,这张图到底在玩什么梗。
从最终的结果来看,Vision-Exp 确实认出了梁文锋和马斯克,还描写了两人的外貌特征,并根据人物身份,推测这张图是在调侃 DeepSeek 给美国 AI 行业带来的冲击,当然这个结论多少有点望文生义的味道了。

Vision-Exp 确实认出了梁文锋和马斯克
不过,一旁也比较明显的的 OpenAI CEO 奥尔特曼,V4-Flash-Vision-Exp 没有人出来,还把他判断成了 "AI 生成的陪衬 "。
而把同一张图片交给豆包,它倒是把三个人都认全了。

还得是你豆包
不过可惜的是,无论是 Vision-Exp 还是豆包,都没有在识别人脸的过程中把这个图背后真正的梗识别出来。这只说明了除了机械的识人之外,模型其实还不够聪明。
那如果画面里没有特征鲜明的人物,换成一张普通风景照呢?
实测证明,Vision-Exp 对景物的识别和描写干得也不错。

Vision-Exp 对景物的识别和描写干得也不错
我们给了它一张成都安顺廊桥的照片。它不仅认出了具体地点,还能分清画面里的时间、光线和空间关系:夕阳从云层里透出来,廊桥横跨河面,水中留下金色倒影,桥后则是现代高楼。
它甚至还能顺着画面继续介绍安顺廊桥的历史,或者把描写整理成一段可以直接发到朋友圈和小红书的文案。
或者我们需要给他再上上难度:根据截图,复刻网页。
根据截图复刻网页,是多模态编码 Agent 最有工作价值的能力之一。现实中的开发者经常拿到一张设计稿或者页面截图,然后要求模型看懂结构,再把它写成真正可以运行的网页。
这次,我们特地选择了幻方量化官网中 " 算力随时待命 " 的页面。

幻方量化官网
这张图看上去只是一个深色科技风网页,里面却塞进了不少细节。左边是一套多层流程图,包含不同颜色的模块、连接线和节点;右边则有正文、切换标签和性能数据,旁边还有一列导航栏。
模型既要看懂各个元素之间的位置关系,还得处理小字号文字、色块渐变和复杂排版,最后再用代码把整张页面搭出来。
Vision-Exp 最终完成了网页的整体框架。左边有流程图,右边有说明文字,底部的性能数据也基本都在。

页面结构搭起来了
但仔细看就会发现,色块边缘和小图标都被明显简化,一些文字也没有待在该在的位置。页面结构虽然搭起来了,距离 " 一比一复刻 " 还有不小差距。
为了判断究竟是任务本身太难,还是 Vision-Exp 确实差了一截,我们又把最近大热的 GLM-5.3 拉了进来,让它按照相同的截图和要求复刻一次。
GLM-5.3 生成的页面观感明显更完整。流程图的层级更清楚,右侧文字基本待在正确的位置,各个模块也没有挤成一团。

GLM-5.3
随后,我们又加入了同样以编码和 Agent 能力见长的 Kimi K3。

Kimi K3
Kimi K3 不仅还原了页面结构,还做出了原图里的色块渐变和发光效果,模块之间的层次也更加接近原图。
把三张页面放到一起,差距就比较明显了。
总的来说,Vision-Exp 已经可以把视觉理解和代码生成串起来。拿它快速验证一个想法、做个可交互 Demo,或者先把页面骨架搭出来,确实有实际价值。
只是在人脸识别、复杂网页复刻和最终呈现上,它与 GLM-5.3、Kimi K3 仍然存在明显差距。
不过,DeepSeek 似乎也没有准备把它包装成一个完成度很高的正式产品。
毕竟,模型名字最后还挂着一个 "Exp"。
一个明显没有完全打磨好的实验版,为什么会被 DeepSeek 提前端上来?

端了个半成品上来
DeepSeek 自己显然也知道,Vision-Exp 还没有完全打磨好。
毕竟,模型名字最后那个 "Exp",已经把 " 实验版 " 三个字写在了脸上。
那 DeepSeek 为什么不再等等,非得先把一个半成品端上来?
从它选择的底座来看,DeepSeek 这次更像是把 V4-Flash 当成了一块多模态试验田。
V4-Pro 拥有 1.6T 总参数和 49B 激活参数,V4-Flash 则只有 284B 总参数和 13B 激活参数。后者原本就是一款更快、更便宜的模型,简单 Agent 任务的表现却能接近 Pro。

把视觉能力先放到 Flash 上,更容易控制好图片带来的额外成本。调用价格足够便宜,开发者才愿意大量拿图片去测试,把它塞进各种 Agent 工作流里。
这个实验版的价值,也会在这些真实任务中慢慢显现出来。
认错梁文锋、看不懂梗图、复刻网页时丢失细节,这些问题很难只靠跑分发现。模型先被放出来,开发者替 DeepSeek 把各种稀奇古怪的图片和任务跑一遍,正式版该补哪些地方,也就有了一张更加具体的问题清单。
而且,Vision-Exp 没有直接取代原来的 V4-Flash。需要稳定处理纯文本任务的用户,依然可以继续使用旧模型;想要尝鲜多模态的开发者,则可以主动切换到 Vision-Exp。

网友发文
一边继续干活,一边开放试验,互不耽误。
这种做法,DeepSeek 以前其实玩过一次。
2025 年 9 月,DeepSeek 推出 V3.2-Exp,用一个实验版本验证全新的 DSA 稀疏注意力机制。直到两个多月后,V3.2 正式版才接过它的位置。
所以从 DeepSeek 过去的发布习惯来看,Vision-Exp 现在更像是一场公开测试。先让这双眼睛睁开,看看真实世界里会出现什么,再决定正式版该怎么改。
只不过,认错自己老爸、把真人当做 AI,也不太会看是认识梗,这些也说明 DeepSeek 在多模态这块还有不少进步空间。到了端上正式版的时候,网友们估计就不再会那么宽容了。

到时候,梁文锋的滑动变祖器,又会停在哪一端呢?
参考资料:
[ 1 ] 极客公园:DeepSeek 上线多模态,我用它做了《牛来》小游戏
[ 2 ] 差评 X.PIN:DeepSeek 的多模态模型,憋了这么久终于来了。。。
[ 3 ] 字母榜:说好 " 多模态不是主线 " 的梁文锋,怎么转头就发了个 Vision 模型?
[ 4 ] Tech 星球:DeepSeek 不是 " 老大 " 了?一张图拉开 40 倍 Token 成本差," 视力 " 却输给豆包?
[ 5 ] APPSO:刚刚,DeepSeek Harness 重磅更新,多模态能力增强;DeepSeek 多模态模型发布,鲸鱼终于开「天眼」了
[ 6 ] 智东西:昨夜,DeepSeek Harness 首发新版本:14 项更新,多模态能力拉满!DeepSeek 多模态模型终于来了!一张图最高只要 0.001 元
主编 : 袁明武 责编 : 海沃德
版式 :伊妍
历史文章
Review





登录后才可以发布评论哦
打开小程序可以发布评论哦