驱动之家 3小时前
DeepSeek-V4-Flash-Vision-Exp视觉模型上线:Agent能力接近Opus-4.8
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 8 月 21 日消息,DeepSeek 在 API 平台正式上线实验性质多模态模型 DeepSeek-V4-Flash-Vision-Exp,开发者设置 model 参数为 deepseek-v4-flash-vision-Exp 即可完成调用。

该版本保留 V4-Flash 全部文本能力,补齐视觉理解能力,多模态 Agent 综合表现接近 Claude Opus-4.8 旗舰水平。

纯文本层面,该模型的推理、知识储备、文本 Agent 能力与 V4-Flash 正式版保持对齐,Terminal Bench 2.1、DeepSWE、DSBench-Hard 等文本类评测维持原有得分,能够继续胜任代码编写、工具调用、长文档处理等原有业务场景。

在视觉相关 Agent 基准测试当中,对比原版 V4-Flash 实现明显跃升,ApexBench、Agents'Last Exam、Chartography 等多模态专项评测分数显著提升,可完成截图解析、界面识别、图表读取、图文混合任务,适配 GUI 智能体、屏幕操作、图文数据分析等开发场景。

计费规则沿用 V4-Flash 现有定价标准,图片输入会转换为 token 参与计费,单张图片最高计 384 tokens,不会额外收取视觉专项费用,百万 token 输入缓存未命中 1 元,输出 2 元,缓存命中可低至 0.02 元每百万 token,降低多模态 Agent 开发的调用成本。

模型延续 100 万 token 超长上下文窗口,支持思考模式,可设置 high、max 推理强度,复杂多模态智能体任务推荐开启 max 档位,适配 Harness 智能体框架,支持工具调用、Function Call,能够结合图片理解完成调研、数据提取、自动化任务编排等链路工作。

官方明确该产品属于 Exp 实验预览版本,不建议直接用于生产环境,后续会根据线上真实调用反馈迭代优化,稳定性、输出效果会持续调整,正式版上线时间暂未对外公布。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

数据分析 界面 效果 自动化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论