暂无菜单项

DeepSeek-V4-Flash-Vision-Exp开源:V4首个多模态模型,视觉Agent能力全面升级

发布于
7

副标题:V4-Flash第一次真正“看见”图片:开源权重、API图文输入与视觉Agent能力一次到位

DeepSeek-V4 系列迎来首个实验性多模态成员:DeepSeek-V4-Flash-Vision-Exp 已开放模型权重。它基于 DeepSeek-V4-Flash 架构集成视觉模块,并通过持续训练获得图片理解能力,可同时处理文本和图像,再配合工具完成更复杂的视觉智能体任务。

该模型此前已于 8 月 21 日上线 DeepSeek API,现在开发者既可以通过云端接口使用,也可以从 Hugging Face 获取开源模型。需要强调的是,名称中的 Exp 代表实验版本:它展示了 DeepSeek V4 的多模态方向,但还不应被简单视为稳定版 V4-Flash 的全面替代品。

模型入口:前往站内导航查看 DeepSeek-V4-Flash-Vision-Exp 模型下载、API与功能介绍

DeepSeek-V4-Flash-Vision-Exp开源公告
DeepSeek-V4-Flash-Vision-Exp 正式开放模型权重

一、这次开源的到底是什么?

DeepSeek-V4-Flash-Vision-Exp 是 V4-Flash 系列的实验性视觉模型。与只能处理文字的型号相比,它可以接收“文本 + 图片”混合输入,让模型读取截图、识别图片文字、分析图表、理解界面布局,并把视觉信息带入后续推理和工具调用。

官方视觉指南列出的输入格式包括 JPEG、PNG、GIF 与 WebP。图片可以通过 Base64、外部 URL 或 Files API 提交;同一图片上传一次后,可通过 file_id 重复引用,减少重复传输。

二、不是单纯看图,而是面向视觉Agent

普通视觉问答只需要回答“图片里有什么”,视觉 Agent 则要在看懂画面后继续行动。例如读取网页截图并定位按钮、分析数据图表后调用脚本、检查软件界面状态、结合终端输出诊断问题,或在多轮任务中持续引用同一批图片。

DeepSeek 对该模型的定位也集中在多模态智能体能力。它可通过 Chat Completions、Messages 与 Responses API 工作,并兼容工具调用。DeepSeek Harness 0.1.1 已加入开箱即用的支持,意味着视觉内容可以直接进入现有 Agent 工作流。

DeepSeek-V4-Flash-Vision-Exp模型架构与视觉能力
视觉模块让 V4-Flash 能在文字推理之外读取截图、图表和真实界面

三、官方基准成绩怎么看?

官方模型卡将 DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash-0731、Opus-4.8 放在同一张表中比较。主要成绩包括:

基准 Vision-Exp V4-Flash-0731 Opus-4.8
DeepSWE 59.3 54.4 58.0
Toolathlon-Verified 75.9 70.3 76.2
Agents’ Last Exam 27.3 25.2 25.7
ZeroBench Pass@5 35.0 34.0

DeepSWE 59.3 高于表中的 Opus-4.8 58.0;Toolathlon-Verified 75.9 与 Opus-4.8 的 76.2 非常接近。在视觉相关的 Agents’ Last Exam 与 ZeroBench 中,Vision-Exp 也取得了领先成绩。

四、并非所有能力都已经领先

基准表同时展示了模型边界。Vision-Exp 在 NL2Repo 得分 57.7,仍低于 Opus-4.8 的 69.7;DSBench-Hard 为 63.6,也落后于 71.7。Terminal Bench 2.1、Cybergym 和 AutomationBench 等项目同样没有全面超过对照模型。

因此,更合理的结论是:它在保留 V4-Flash 文本 Agent 水平的同时,显著补上视觉能力,并在部分视觉和软件工程任务上表现突出。这不等于它已经在所有编程、数据科学或自动化任务中成为第一。

DeepSeek-V4-Flash-Vision-Exp基准测试对比
官方基准表显示:视觉Agent提升明显,但复杂代码仓库与数据科学任务仍有差距

五、API怎样调用?

云端调用时,将模型名称设置为 deepseek-v4-flash-vision-exp。DeepSeek API 同时提供 OpenAI 格式与 Anthropic 格式接口,开发者可在兼容 SDK 中切换 Base URL 和模型名。

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [{
    "role": "user",
    "content": [
      {"type": "text", "text": "分析这张界面截图并列出可操作项"},
      {"type": "image_url", "image_url": {"url": "https://example.com/ui.webp"}}
    ]
  }]
}

图片会被转换为视觉 Token 计费,官方说明每张图片最多按 384 Token 计算,并使用 V4-Flash 对应价格。价格和限制可能调整,正式接入前应再次查看最新控制台与文档。

六、开源部署需要关注什么?

虽然模型已公开权重,但“能下载”并不等于普通显卡能够轻松部署。V4 系列属于大规模 MoE 模型,本地推理涉及模型权重、量化格式、推理框架、显存/内存容量、专家加载策略和吞吐要求。

部署前建议依次确认:

  1. 模型卡提供的许可证和允许用途;
  2. 完整权重与量化版本的存储、内存和显存需求;
  3. 推理框架是否真正支持该视觉架构,而不只是支持文本版 V4;
  4. 图片预处理、上下文长度和并发条件下的实际吞吐;
  5. 视觉任务准确率、隐私和错误操作风险。

七、哪些场景最值得尝试?

  • UI与网页理解:读取截图、识别控件、生成测试步骤或辅助浏览器 Agent。
  • 图表与报表分析:把可视化图表转成结构化结论,再调用数据工具验证。
  • 软件工程:同时理解代码、终端输出、报错截图和产品界面。
  • 视觉内容审核:检查海报、页面、视频帧中的文字、布局和异常信息。
  • 多模态知识助手:在文档、图片、流程图和结构化资料之间进行综合问答。

八、一个月多轮更新,DeepSeek V4的路线已经清晰

从 7 月 31 日 V4-Flash 正式版 API,到 8 月 13 日 V4-Pro 与 DeepSeek Harness,再到 8 月 21 日 Vision-Exp API 和随后开放模型权重,DeepSeek V4 正在形成“高效基础模型 + 专业版 + 多模态实验版 + Agent Harness”的产品组合。

这条路线说明 DeepSeek 的竞争重点已不再只是聊天与推理分数,而是把长上下文、视觉理解、工具调用和 Agent 执行整合到同一套开发体系中。

结语:真正重要的是“看懂以后还能行动”

DeepSeek-V4-Flash-Vision-Exp 的价值,不只是让 V4-Flash 能描述图片,而是把视觉信息接进 Agent 的任务链。截图、图表、界面和代码可以进入同一个上下文,模型再继续调用工具、修改文件或完成自动化步骤。

它仍是实验型号,基准也不能代替真实项目验证。但对于正在构建视觉 Agent、自动化测试、图表分析和多模态编程助手的团队,这次开源提供了一个值得实际评测的新选择。

常见问题(FAQ)

DeepSeek-V4-Flash-Vision-Exp是正式版吗?
不是。官方将其标注为实验性多模态视觉模型,生产使用前需要验证稳定性和任务准确率。
这个模型已经开源了吗?
是。DeepSeek已在Hugging Face公开模型权重、配置文件和模型卡。
Vision-Exp支持哪些图片格式?
官方指南列出JPEG、PNG、GIF和WebP,可通过Base64、外部URL或Files API提交图片。
API调用的模型名是什么?
模型名为deepseek-v4-flash-vision-exp,支持Chat Completions、Messages与Responses API。
它的视觉Agent性能如何?
官方基准中Agents' Last Exam为27.3,ZeroBench Pass@5为35.0;文本Agent能力总体与V4-Flash-0731相当。
普通消费级显卡能本地部署吗?
不能只凭“开源”判断。V4属于大规模MoE模型,需要核对权重、量化、推理框架以及显存和内存需求后再决定部署方案。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材