①
8 月 21 日傍晚,DeepSeek 正式上线实验版多模态模型 DeepSeek-V4-Flash-Vision-Exp。
这款模型可以读取 JPEG、PNG、GIF、WebP 等格式图片,能够识图、读取截图文字、分析图表。

开发者调用 API 时,指定对应模型名称即可上传图片,支持 Base64、URL、Files API 上传,单张图片最高折算 384 tokens。
计费和 V4-Flash 一致,输入定价仅 3 元每百万 token,低谷时段还可享五折优惠。换算下来,处理 1000 张图片的输入成本只需 1.15 元,谷时调用甚至不到 0.6 元。
按上限 384 token/ 张计算:✅ 正常时段(0.001152 元 / 张):0.01 ÷ 0.001152 ≈ 8.68 张 → 1 分钱大约能跑 8 张图
✅ 低谷五折时段(0.000576 元 / 张):0.01 ÷ 0.000576 ≈ 17.36 张 → 1 分钱大约能跑 17 张图
②
根据 DS 官方提供的信息显示,纯文本推理、代码 Agent 能力和 V4-Flash 正式版持平,新增的视觉相关任务能力提升明显,官方评测显示多模态 Agent 性能接近 Claude Opus-4.8。

③
DeepSeek Harness 也同步更新适配 V4-Flash-Vision-Exp,方便搭建多模态智能体流程。
新模型能很好兼容各类 Agent 框架,多模态适配表现不错,大家搭配不同 Agent 工具,就能拓展出更多实用工作场景。
请看 DS 官方给的示例:


上下滑动或点击放大查看 PPT 内页完整内容效果
④ 网友热议
" 太好了,终于出来了 "
" 一张图片最多占 384 tokens!立刻体验!"
" 鲸鱼长眼了!!!"
" 太好了,DSH 直接接通 API"
(参考:DS,本文经由 AI 优化)


登录后才可以发布评论哦
打开小程序可以发布评论哦