【CNMO 科技消息】8 月 21 日消息,深度求索宣布,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。作为一款实验性质的模型,该模型在保留文本理解、推理和 Agent 能力的同时,进一步加入视觉理解能力,用户可以通过 API 直接调用。此次更新也意味着 DeepSeek 进一步将多模态能力向 Agent 应用场景延伸,为 PPT 制作、网页开发以及前端创意等任务提供新的模型能力支持。

DeepSeek
从官方公布的信息来看,DeepSeek-V4-Flash-Vision-Exp 的核心特点在于兼顾文本和多模态能力。在 Agent、推理、世界知识等纯文本任务中,该模型的表现与 DeepSeek-V4-Flash 正式版基本持平,并没有因为增加视觉能力而明显牺牲文本处理能力。而在需要理解图像内容的 Agent Benchmark 中,新模型相比 DeepSeek-V4-Flash 则实现了明显提升,多模态 Agent 能力已经接近 Opus-4.8。
在实际应用方面,深度求索展示了多个使用案例。其中一个场景是借助 Agent 框架制作商业定制西藏自驾游 PPT。用户可以直接提出包括路线、行程周期、目标客户以及视觉风格在内的复杂要求,模型随后结合多模态能力完成内容和视觉呈现。另一个案例则是对 DeepSeek Harness 官网进行二次创作,通过黑蓝深海、玻璃 UI 以及 ASCII 原子像素等视觉元素,在多轮交互后生成具有未来主义风格的开发者网站。此外,模型还可以用于制作动态前端 Mini Demo,例如按照 "3D 黏土小怪物加入复古舞池派对 " 的创意生成相应的动态视觉效果。
从这些案例可以看出,此次升级的重点并不只是让模型具备 " 看图 " 能力,而是希望将视觉理解进一步融入 Agent 工作流程。对于需要同时处理文字、图片、网页以及代码的任务而言,模型能够理解视觉信息后,可以进一步参与内容生成、页面设计和交互开发,从而覆盖更多此前主要依靠文本模型完成效果有限的使用场景。
API 服务方面,开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 调用这一实验模型。图片在 API 服务中会转换为 Token 并按照 Token 计费,单张图片最多占用 384 个 Token,整体计费价格与 DeepSeek-V4-Flash 保持一致。接口目前支持 Chat Completions、Messages 和 Responses 三种调用格式,并支持图文混合输入。图片既可以通过 Base64 内联方式传入,也可以使用外部 URL 或 Files API 进行调用,因此能够适配不同的 Agent 开发框架和应用场景。
与此同时,深度求索还宣布 Files API 正式开放,而且该 API 本身不收取费用。开发者可以提前将图片上传至平台,之后在 API 请求中直接通过 file_id 引用对应文件,无需在每一次请求中重复上传同一张图片。对于需要反复调用相同素材的 Agent 应用而言,这种方式能够减少重复传输带来的带宽开销,也有助于简化开发流程。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦