### [DeepSeek-V4-Flash-Vision-Exp开源:V4首个多模态模型,视觉Agent能力全面升级](https://www.zuoshipin.com/article/30147) **Published:** 2026-08-31T15:11:19 **Author:** 天才交易员 **Excerpt:** DeepSeek开源V4-Flash-Vision-Exp实验性多模态模型,支持图文混合输入、视觉理解、工具调… **副标题:**V4-Flash第一次真正“看见”图片:开源权重、API图文输入与视觉Agent能力一次到位 DeepSeek-V4 系列迎来首个实验性多模态成员:**DeepSeek-V4-Flash-Vision-Exp** 已开放模型权重。它基于 DeepSeek-V4-Flash 架构集成视觉模块,并通过持续训练获得图片理解能力,可同时处理文本和图像,再配合工具完成更复杂的视觉智能体任务。 该模型此前已于 8 月 21 日上线 DeepSeek API,现在开发者既可以通过云端接口使用,也可以从 Hugging Face 获取开源模型。需要强调的是,名称中的 **Exp** 代表实验版本:它展示了 DeepSeek V4 的多模态方向,但还不应被简单视为稳定版 V4-Flash 的全面替代品。 **模型入口:**前往站内导航查看 [DeepSeek-V4-Flash-Vision-Exp 模型下载、API与功能介绍](https://www.zuoshipin.com/link/30129.html)。 ![DeepSeek-V4-Flash-Vision-Exp开源公告](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5c0db84e-a543-11f1-9832-fa163e47d677.webp) DeepSeek-V4-Flash-Vision-Exp 正式开放模型权重 ## 一、这次开源的到底是什么? DeepSeek-V4-Flash-Vision-Exp 是 V4-Flash 系列的实验性视觉模型。与只能处理文字的型号相比,它可以接收“文本 + 图片”混合输入,让模型读取截图、识别图片文字、分析图表、理解界面布局,并把视觉信息带入后续推理和工具调用。 官方视觉指南列出的输入格式包括 JPEG、PNG、GIF 与 WebP。图片可以通过 Base64、外部 URL 或 Files API 提交;同一图片上传一次后,可通过 `file_id` 重复引用,减少重复传输。 ## 二、不是单纯看图,而是面向视觉Agent 普通视觉问答只需要回答“图片里有什么”,视觉 Agent 则要在看懂画面后继续行动。例如读取网页截图并定位按钮、分析数据图表后调用脚本、检查软件界面状态、结合终端输出诊断问题,或在多轮任务中持续引用同一批图片。 DeepSeek 对该模型的定位也集中在多模态智能体能力。它可通过 Chat Completions、Messages 与 Responses API 工作,并兼容工具调用。DeepSeek Harness 0.1.1 已加入开箱即用的支持,意味着视觉内容可以直接进入现有 Agent 工作流。 ![DeepSeek-V4-Flash-Vision-Exp模型架构与视觉能力](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5c92bd53-a543-11f1-a1c0-fa163e47d677.webp) 视觉模块让 V4-Flash 能在文字推理之外读取截图、图表和真实界面 ## 三、官方基准成绩怎么看? 官方模型卡将 DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash-0731、Opus-4.8 放在同一张表中比较。主要成绩包括: | 基准 | Vision-Exp | V4-Flash-0731 | Opus-4.8 | | --- | --- | --- | --- | | DeepSWE | **59.3** | 54.4 | 58.0 | | Toolathlon-Verified | **75.9** | 70.3 | 76.2 | | Agents’ Last Exam | **27.3** | 25.2 | 25.7 | | ZeroBench Pass@5 | **35.0** | — | 34.0 | DeepSWE 59.3 高于表中的 Opus-4.8 58.0;Toolathlon-Verified 75.9 与 Opus-4.8 的 76.2 非常接近。在视觉相关的 Agents’ Last Exam 与 ZeroBench 中,Vision-Exp 也取得了领先成绩。 ## 四、并非所有能力都已经领先 基准表同时展示了模型边界。Vision-Exp 在 NL2Repo 得分 57.7,仍低于 Opus-4.8 的 69.7;DSBench-Hard 为 63.6,也落后于 71.7。Terminal Bench 2.1、Cybergym 和 AutomationBench 等项目同样没有全面超过对照模型。 因此,更合理的结论是:**它在保留 V4-Flash 文本 Agent 水平的同时,显著补上视觉能力,并在部分视觉和软件工程任务上表现突出**。这不等于它已经在所有编程、数据科学或自动化任务中成为第一。 ![DeepSeek-V4-Flash-Vision-Exp基准测试对比](https://admin.zuoshipin.com/wp-content/uploads/2026/08/5cfefd41-a543-11f1-8246-fa163e47d677.webp) 官方基准表显示:视觉Agent提升明显,但复杂代码仓库与数据科学任务仍有差距 ## 五、API怎样调用? 云端调用时,将模型名称设置为 `deepseek-v4-flash-vision-exp`。DeepSeek API 同时提供 OpenAI 格式与 Anthropic 格式接口,开发者可在兼容 SDK 中切换 Base URL 和模型名。 ``` { "model": "deepseek-v4-flash-vision-exp", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "分析这张界面截图并列出可操作项"}, {"type": "image_url", "image_url": {"url": "https://example.com/ui.webp"}} ] }] } ``` 图片会被转换为视觉 Token 计费,官方说明每张图片最多按 384 Token 计算,并使用 V4-Flash 对应价格。价格和限制可能调整,正式接入前应再次查看最新控制台与文档。 ## 六、开源部署需要关注什么? 虽然模型已公开权重,但“能下载”并不等于普通显卡能够轻松部署。V4 系列属于大规模 MoE 模型,本地推理涉及模型权重、量化格式、推理框架、显存/内存容量、专家加载策略和吞吐要求。 部署前建议依次确认: 1. 模型卡提供的许可证和允许用途; 2. 完整权重与量化版本的存储、内存和显存需求; 3. 推理框架是否真正支持该视觉架构,而不只是支持文本版 V4; 4. 图片预处理、上下文长度和并发条件下的实际吞吐; 5. 视觉任务准确率、隐私和错误操作风险。 ## 七、哪些场景最值得尝试? - **UI与网页理解:**读取截图、识别控件、生成测试步骤或辅助浏览器 Agent。 - **图表与报表分析:**把可视化图表转成结构化结论,再调用数据工具验证。 - **软件工程:**同时理解代码、终端输出、报错截图和产品界面。 - **视觉内容审核:**检查海报、页面、视频帧中的文字、布局和异常信息。 - **多模态知识助手:**在文档、图片、流程图和结构化资料之间进行综合问答。 ## 八、一个月多轮更新,DeepSeek V4的路线已经清晰 从 7 月 31 日 V4-Flash 正式版 API,到 8 月 13 日 V4-Pro 与 DeepSeek Harness,再到 8 月 21 日 Vision-Exp API 和随后开放模型权重,DeepSeek V4 正在形成“高效基础模型 + 专业版 + 多模态实验版 + Agent Harness”的产品组合。 这条路线说明 DeepSeek 的竞争重点已不再只是聊天与推理分数,而是把长上下文、视觉理解、工具调用和 Agent 执行整合到同一套开发体系中。 ## 结语:真正重要的是“看懂以后还能行动” DeepSeek-V4-Flash-Vision-Exp 的价值,不只是让 V4-Flash 能描述图片,而是把视觉信息接进 Agent 的任务链。截图、图表、界面和代码可以进入同一个上下文,模型再继续调用工具、修改文件或完成自动化步骤。 它仍是实验型号,基准也不能代替真实项目验证。但对于正在构建视觉 Agent、自动化测试、图表分析和多模态编程助手的团队,这次开源提供了一个值得实际评测的新选择。 **Tags:** AI智能体, DeepSeek, DeepSeek-V4, Hugging Face, 多模态模型, 开源模型, 视觉模型 **Categories:** AI资讯 ---