副标题:V4-Flash第一次真正“看见”图片:开源权重、API图文输入与视觉Agent能力一次到位
DeepSeek-V4 系列迎来首个实验性多模态成员:DeepSeek-V4-Flash-Vision-Exp 已开放模型权重。它基于 DeepSeek-V4-Flash 架构集成视觉模块,并通过持续训练获得图片理解能力,可同时处理文本和图像,再配合工具完成更复杂的视觉智能体任务。
该模型此前已于 8 月 21 日上线 DeepSeek API,现在开发者既可以通过云端接口使用,也可以从 Hugging Face 获取开源模型。需要强调的是,名称中的 Exp 代表实验版本:它展示了 DeepSeek V4 的多模态方向,但还不应被简单视为稳定版 V4-Flash 的全面替代品。
模型入口:前往站内导航查看 DeepSeek-V4-Flash-Vision-Exp 模型下载、API与功能介绍。

一、这次开源的到底是什么?
DeepSeek-V4-Flash-Vision-Exp 是 V4-Flash 系列的实验性视觉模型。与只能处理文字的型号相比,它可以接收“文本 + 图片”混合输入,让模型读取截图、识别图片文字、分析图表、理解界面布局,并把视觉信息带入后续推理和工具调用。
官方视觉指南列出的输入格式包括 JPEG、PNG、GIF 与 WebP。图片可以通过 Base64、外部 URL 或 Files API 提交;同一图片上传一次后,可通过 file_id 重复引用,减少重复传输。
二、不是单纯看图,而是面向视觉Agent
普通视觉问答只需要回答“图片里有什么”,视觉 Agent 则要在看懂画面后继续行动。例如读取网页截图并定位按钮、分析数据图表后调用脚本、检查软件界面状态、结合终端输出诊断问题,或在多轮任务中持续引用同一批图片。
DeepSeek 对该模型的定位也集中在多模态智能体能力。它可通过 Chat Completions、Messages 与 Responses API 工作,并兼容工具调用。DeepSeek Harness 0.1.1 已加入开箱即用的支持,意味着视觉内容可以直接进入现有 Agent 工作流。

三、官方基准成绩怎么看?
官方模型卡将 DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash-0731、Opus-4.8 放在同一张表中比较。主要成绩包括:
| 基准 | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| Agents’ Last Exam | 27.3 | 25.2 | 25.7 |
| ZeroBench Pass@5 | 35.0 | — | 34.0 |
DeepSWE 59.3 高于表中的 Opus-4.8 58.0;Toolathlon-Verified 75.9 与 Opus-4.8 的 76.2 非常接近。在视觉相关的 Agents’ Last Exam 与 ZeroBench 中,Vision-Exp 也取得了领先成绩。
四、并非所有能力都已经领先
基准表同时展示了模型边界。Vision-Exp 在 NL2Repo 得分 57.7,仍低于 Opus-4.8 的 69.7;DSBench-Hard 为 63.6,也落后于 71.7。Terminal Bench 2.1、Cybergym 和 AutomationBench 等项目同样没有全面超过对照模型。
因此,更合理的结论是:它在保留 V4-Flash 文本 Agent 水平的同时,显著补上视觉能力,并在部分视觉和软件工程任务上表现突出。这不等于它已经在所有编程、数据科学或自动化任务中成为第一。

五、API怎样调用?
云端调用时,将模型名称设置为 deepseek-v4-flash-vision-exp。DeepSeek API 同时提供 OpenAI 格式与 Anthropic 格式接口,开发者可在兼容 SDK 中切换 Base URL 和模型名。
{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "分析这张界面截图并列出可操作项"},
{"type": "image_url", "image_url": {"url": "https://example.com/ui.webp"}}
]
}]
}图片会被转换为视觉 Token 计费,官方说明每张图片最多按 384 Token 计算,并使用 V4-Flash 对应价格。价格和限制可能调整,正式接入前应再次查看最新控制台与文档。
六、开源部署需要关注什么?
虽然模型已公开权重,但“能下载”并不等于普通显卡能够轻松部署。V4 系列属于大规模 MoE 模型,本地推理涉及模型权重、量化格式、推理框架、显存/内存容量、专家加载策略和吞吐要求。
部署前建议依次确认:
- 模型卡提供的许可证和允许用途;
- 完整权重与量化版本的存储、内存和显存需求;
- 推理框架是否真正支持该视觉架构,而不只是支持文本版 V4;
- 图片预处理、上下文长度和并发条件下的实际吞吐;
- 视觉任务准确率、隐私和错误操作风险。
七、哪些场景最值得尝试?
- UI与网页理解:读取截图、识别控件、生成测试步骤或辅助浏览器 Agent。
- 图表与报表分析:把可视化图表转成结构化结论,再调用数据工具验证。
- 软件工程:同时理解代码、终端输出、报错截图和产品界面。
- 视觉内容审核:检查海报、页面、视频帧中的文字、布局和异常信息。
- 多模态知识助手:在文档、图片、流程图和结构化资料之间进行综合问答。
八、一个月多轮更新,DeepSeek V4的路线已经清晰
从 7 月 31 日 V4-Flash 正式版 API,到 8 月 13 日 V4-Pro 与 DeepSeek Harness,再到 8 月 21 日 Vision-Exp API 和随后开放模型权重,DeepSeek V4 正在形成“高效基础模型 + 专业版 + 多模态实验版 + Agent Harness”的产品组合。
这条路线说明 DeepSeek 的竞争重点已不再只是聊天与推理分数,而是把长上下文、视觉理解、工具调用和 Agent 执行整合到同一套开发体系中。
结语:真正重要的是“看懂以后还能行动”
DeepSeek-V4-Flash-Vision-Exp 的价值,不只是让 V4-Flash 能描述图片,而是把视觉信息接进 Agent 的任务链。截图、图表、界面和代码可以进入同一个上下文,模型再继续调用工具、修改文件或完成自动化步骤。
它仍是实验型号,基准也不能代替真实项目验证。但对于正在构建视觉 Agent、自动化测试、图表分析和多模态编程助手的团队,这次开源提供了一个值得实际评测的新选择。










