只改一个模型名就能调用,20路并发、9月10日自动下线:这不是普通的Flash小更新,而是一场低价模型能否接管高配任务的公开压力测试。
先说预测:DeepSeek V4.1 Flash大概率不会只是一个两天后消失的临时型号。它更像DeepSeek在正式换代前放出的一次公开压力测试:如果Flash的速度与价格可以覆盖过去必须交给Pro的任务,那么下一轮竞争就不再只是“谁更聪明”,而是谁能把高强度能力做成默认消费品。
但先把边界说清楚:2026年9月8日流出的通知来自DeepSeek官方群,模型可以通过官方API调用;截至发稿,DeepSeek公开更新日志最新条目仍是8月21日的V4 Flash视觉实验版,尚未给V4.1 Flash单独建立正式说明。因此,下面会把已确认的调用信息与公开体验者的实测感受分开呈现。

只有两天的V4.1 Flash,到底开放了什么?
内测通知给出的信息非常直接:DeepSeek V4.1 Flash采用新的模型结构,原生支持多模态,强调能力更强、速度更快和成本更低。已有DeepSeek API用户不需要修改base_url,只要把模型名称改成:
base_url = "https://api.deepseek.com"
model = "deepseek-v4.1-flash-expires-on-0910"
api_key = "你的 DeepSeek API Key"测试期间的计费暂与DeepSeek V4 Flash相同,每个账户最多20路并发。模型名中的expires-on-0910也把风险写在了脸上:该临时路由预计在9月10日过期,不能直接硬编码进长期生产环境。

更值得玩味的是问卷里的一道题:“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”这不能被当成官方宣布V4.1 Flash已经等同Pro,但它至少暴露了本次测试的观察目标:Flash不只要接替旧Flash,还想向Pro的任务覆盖面靠拢。

第一轮:中文长文,少一点模板感
公开体验先把模型接入Claude Code,再用上一年度高考作文题测试中文长文。结果的亮点不是堆更多金句,而是开头、转折和结尾有明显设计,情绪推进也更自然,没有频繁用名言硬抬主题。

对内容团队来说,这种改进比“文采分数”更实用:一篇可编辑的初稿首先要结构稳定、段落之间能接得住,随后编辑才有空间补事实、调整语气和删掉套话。不过单篇作文只能说明风格倾向,不能证明模型已经全面胜过V4 Pro。
第二轮:5分钟做出能显影的拍立得网页
第二个任务要求模型只用HTML、CSS和JavaScript做一台可互动的拍立得。为了便于复现,原测试中的核心Prompt整理如下,页面细节仍以截图为准:
请使用 HTML、CSS 和 JavaScript 完整模拟一台拍立得相机的交互与摄影过程。点击立体快门按钮后,屏幕先出现一瞬间强烈的全白闪光灯过曝特效;接着,一张带有复古白边的相纸从上方暗窗中带着机械阻尼感平滑吐出。相纸画面通过真实的化学显影效果,从一片灰黑色在 8—10 秒内缓慢、平滑地淡入彩色图像,照片表面覆盖一层有质感的噪点滤镜。


模型约5分钟交付结果。相机外壳、镜头、快门和相纸出口的空间关系比较清楚,闪光、吐纸和显影也形成了完整反馈链。对前端原型而言,最有价值的不是“画得像不像”,而是它能在一次长输出里同时维持视觉层级、状态切换和时间动画。
第三轮:一个HTML塞进整套网页操作系统
在一个 HTML 文件中制作一套类似 macOS 的网页操作系统,同时包含文本编辑器、终端、Python 环境、代码编辑器、游戏、文件管理器、绘图工具和视频编辑器。

这个任务同时要求文本编辑器、终端、Python环境、代码编辑器、游戏、文件管理器、绘图和视频编辑,范围很大。公开结果可以运行,但整体只算中规中矩:它更像一套功能入口完整的视觉Demo,并不等于各个应用都具备真实生产能力。
这也是评估AI前端最容易踩的坑:页面“看起来有八个应用”,不代表数据状态、文件持久化、权限、异常处理和跨窗口交互真的做完。验收时必须逐个点功能,而不是只看首屏。
第四轮:飞船HUD把视差层级做出来了
请使用 HTML、CSS 和 JavaScript 构建一个科幻飞船驾驶舱 HUD。页面采用第一人称视角,中心是动态准星,周围包含航向、速度、能量、目标锁定和雷达信息。移动鼠标控制飞船方向时,整个 HUD 产生真实的视差位移,通过中心准星、外围仪表和背景采用不同响应速度,制造驾驶舱玻璃、飞船姿态与远处空间之间的纵深感。


这组结果比网页系统更有说服力。中心准星响应最灵敏,外围仪表稍慢,背景移动幅度更小,三层速度差制造出了玻璃、飞船姿态与远处空间的纵深感。它说明模型不只是会堆霓虹线条,也开始理解交互视觉中“不同层级应该怎样动”。
V4.1 Flash、V4 Flash和V4 Pro怎么选?
| 模型 | 当前定位 | 优势 | 主要风险 |
|---|---|---|---|
| V4.1 Flash | 限时中间版本 | 新架构、原生多模态、速度和成本效率目标更激进 | 9月10日过期,官方完整基准与正式文档尚缺 |
| V4 Flash | 公开测试的高性价比API模型 | 调用稳定、适合高频生成与Agent任务 | 复杂任务上限通常低于Pro |
| V4 Pro | 正式高性能型号 | 复杂推理、生产Agent和高难度编码更稳 | 延迟与成本通常更高 |
实用选择:两天内做兼容性和速度测试可用V4.1 Flash;需要稳定批量调用继续用V4 Flash;复杂Agent、长链路编码和错误成本高的任务优先V4 Pro。不要因为一次漂亮Demo就把生产流量全部切过去。
开发者现在怎么测,才不浪费这48小时?
- 只改模型名:复用当前DeepSeek客户端和base_url,不要同时升级SDK、重写Prompt和替换模型,否则很难定位差异。
- 准备固定样本:至少覆盖中文长文、结构化JSON、工具调用、长代码修改、图片输入和连续多轮对话。
- 记录四项指标:首Token延迟、总生成时间、总Token量和人工返工时间,单看tokens/s会误判真实效率。
- 验证边界:检查函数参数、JSON转义、长上下文后稳定性、图片格式、并发和错误码。
- 先做回退:在配置层准备V4 Flash或V4 Pro备用模型,9月10日临时路由失效后可以立即切换。
生产提醒:临时模型名不要散落在业务代码里。把模型ID放入环境变量或配置中心,并对过期、限流、超时、空响应和结构化输出失败设置自动回退。
站在创作者和开发者角度,我更看重什么?
这次实测真正打动人的不是某个静态页面,而是长输出过程没有明显崩掉。拍立得和HUD都需要同时处理造型、动画、状态与交互;如果模型能在更高生成速度下维持这种一致性,反复试错的时间成本会明显下降。
但“Flash替代Pro”必须看失败率,而不是看最好的一次结果。生产工作里,连续十次都正确的80分,往往比偶尔一次95分、两次结构崩坏更有价值。V4.1 Flash最终能不能成为默认模型,要等正式基准、更多任务复测和官方稳定版本,而不是现在就下结论。
相关入口与站内导航
DeepSeek站内导航:
https://www.zuoshipin.com/link/873.html
DeepSeek V4 Flash视觉实验版站内导航:
https://www.zuoshipin.com/link/30129.html
DeepSeek API官方文档: 查看调用说明与最新更新日志











