DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 开源的实验性多模态视觉理解模型,在 V4-Flash 架构上加入视觉模块,可同时处理文本与图片,并结合工具完成视觉智能体任务。
核心能力
- 支持 JPEG、PNG、GIF、WebP 图片输入
- 可读取截图文字、分析图表、理解界面和图片内容
- 支持 Chat Completions、Messages 与 Responses API
- 兼容工具调用和 DeepSeek Harness 智能体工作流
- 提供 Hugging Face 开源权重与模型卡
性能定位
官方模型卡显示,该模型在纯文本 Agent 任务上与 DeepSeek-V4-Flash-0731 基本相当,在需要视觉理解的智能体基准上提升明显;DeepSWE 为 59.3,Toolathlon-Verified 为 75.9,ZeroBench Pass@5 为 35.0。
适合场景
适合截图理解、图表分析、界面巡检、视觉问答、多模态工具调用,以及需要同时阅读代码、终端输出和产品界面的 Agent 工作流。
使用提醒
该型号仍标注为实验版本。基准成绩来自官方设定,不能直接等同于所有生产任务表现;部署与商用前请核对模型许可证、显存需求、API价格和最新文档。








