谷歌把旗舰级推理与编程能力压进 Flash 价格带:Gemini 3.8 Flash 面向大众和开发者,Cyber 版本则只向受信任防御机构开放。
Google 正式发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者定位为面向大规模 Agent、软件工程和复杂知识工作的高性价比通用模型;后者专攻漏洞发现与自动修复,通过 Fairwind Program 向政府、关键基础设施运营方和软件维护者等受信任机构提供。
3.8 Flash 的入门价格为每百万输入 Token 0.75 美元、输出 3.75 美元,支持 100 万 Token 输入上下文、最长 6.4 万 Token 文本输出,并可接收文本、图片、音频、视频和 PDF。这个价格是限时入门价,将于 2026 年 12 月 31 日结束。

Gemini 3.8 Flash 核心规格一览
| 模型定位 | 编码、Agent、复杂推理与知识工作 |
| 输入模态 | 文本、图像、视频、音频、PDF |
| 输出 | 文本,最长 64K Token |
| 上下文 | 最高 1M Token |
| 工具能力 | 函数调用、搜索、Computer Use |
| API 型号 | gemini-3.8-flash |
| 开放状态 | 正式可用(General availability) |


价格为什么重要:Flash 让多轮 Agent 循环更可负担
Gemini 3.8 Flash 在 2026 年底前的入门价是输入 0.75 美元/百万 Token、输出 3.75 美元/百万 Token。2027 年 1 月 1 日起,官方计划调整为输入 1.50 美元、输出 7.50 美元。无论按哪个价格,它的核心策略都是用较低单价支持更多推理步骤和工具调用。
谷歌表示,高 effort 模式下模型可能主动使用更多 Token,以换取更好的结果。因此“单价便宜”不必然等于“每个任务都便宜”。评估真实成本时,应同时统计输入长度、工具返回内容、重试次数、输出规模和任务成功率。对超长代码库或 Agent 工作流,单位任务成本比 Token 单价更有意义。



编程与长程 Agent:DeepSWE 是最值得关注的信号
Google 将 Gemini 3.8 Flash 定位为“最智能的工作马模型”,重点不是一次回答,而是端到端解决工程问题。官方材料显示,它在 DeepSWE v1.1 长周期软件工程评测中超过多数更大的前沿模型,同时保持更低任务成本;还支持函数调用、搜索和计算机操作,适合需要连续执行的 Agent。
模型页面展示的其他成绩包括 HLE-Verified 54.9%、Vals Finance Agent v2 61.4%。这些结果反映其多步骤推理和专业工作流潜力,但官方基准可能与企业仓库、依赖环境和验收标准不同。实际使用应设置测试、回滚、预算上限、权限范围和人工批准点。




所谓“RSI 一大步”,应该怎样理解
报道中把这次更新称为递归自我改进(Recursive Self-Improvement,RSI)的一大步,主要来自长期 Agent 循环会反复评估、验证和修正结果。Google 官方也提到,两款模型借助长时间 Agent 循环进行递归评估和改进。
但这不等于模型已经能够自主修改权重、独立训练下一代模型或实现失控式能力增长。更准确的描述是:低成本、高速度和更强工具调用,让模型在单个任务中进行更多轮“计划—执行—验证—修正”。这是工作流层面的自我修正,而非已经得到证明的通用递归自我进化。


基准争议:榜单领先不代表所有实战都领先
Gemini 3.8 Flash 在不同基准上的排名并不完全一致,这很正常。终端、代码仓库、金融、法律、通识推理和计算机操作测试衡量的是不同能力;同名基准的版本、提示词、工具环境和评审方式也可能不同。
尤其需要防止训练数据污染、针对公开题库优化以及把“高 effort 多次迭代”与其他模型的单次回答直接比较。更可靠的企业评测应使用未公开任务、统一工具、相同预算和盲评,并记录一次成功率、修复次数、总 Token、耗时和人工返工成本。



为什么先发 Flash,而不是新的 Pro
Gemini 3.8 Flash 建立在 3.7 Flash 之上,是六周内的第三次 Flash 更新。Google 的公开定位强调规模化、响应速度和长程 Agent,而不是用“更大参数”作为唯一卖点。对于需要频繁调用工具和快速迭代的产品,小而快、每轮便宜的模型可能比单次推理更强但更慢的模型更具总成本优势。
关于未发布 Pro 候选版本、内部人员变动或下一代训练进度的说法,如果没有官方文件支持,只能作为行业传闻,不能当作已确认事实。可以确认的是,Google 仍在模型页面列出 Gemini 3.5 Pro “coming soon”,而 3.8 Flash 已正式可用。

Gemini 3.8 Flash Cyber:受限开放的网络防御模型
Gemini 3.8 Flash Cyber 与通用版共享基础能力,但拥有更适合专业网络防御的安全策略。它通过 Fairwind Program 向受信任防御机构提供,不是所有用户都能在普通 Gemini 产品或 API 中直接选择。
Google 披露,Cyber 版在覆盖20种编程语言的内部漏洞发现测试中成功率超过70%;在 CWE-Bench 自动修复评测中 pass@1 为47.2%,接近领先前沿模型的47.8%。Chrome 安全团队称其生成的正确补丁数量是此前最佳大型商业模型的2.6倍;Google Cloud 漏洞研究团队还用它在不到两小时内发现一项关键基础漏洞。
这些数据说明低成本模型可以帮助防御团队扩大代码审计覆盖,但不能取代安全工程师。漏洞验证、补丁回归、供应链影响、披露流程与生产上线都需要人工负责;涉及攻击性任务时还必须遵守授权范围与法律要求。

如何使用 Gemini 3.8 Flash
- 个人用户:可通过 Gemini App、Google Search AI Mode 等支持渠道使用。
- 开发者:可在 Google AI Studio、Gemini API、Android Studio 和 Google Antigravity 中调用。
- 企业:可通过 Gemini Enterprise Agent Platform 接入。
- Cyber 用户:需申请 Fairwind Program,普通 API 账户不会自动获得权限。
站内已整理通用使用入口,可访问 Gemini 前台导航页。建议开发者在 2026 年底的入门价格期内完成任务成功率和总成本测试,并为 2027 年价格调整预留预算。


使用限制与风险清单
- 模型可能产生幻觉,关键事实、代码和补丁必须验证。
- 高 effort 可能使用更多 Token,并出现偶发变慢或超时。
- 官方知识截止日期主要为2026年3月,部分领域可能只覆盖到2025年1月。
- 非英语安全表现相较3.7 Flash略有回退,中文高风险场景应额外测试。
- Cyber 版仅限受信任防御者,不能把官方演示理解为公开渗透测试工具。
- 入门价格将在2026年底到期,长期产品需按2027年价格重新测算。
总结:速度与价格正在成为 Agent 智力的一部分
Gemini 3.8 Flash 的意义不是简单“用 Flash 打败所有旗舰”,而是展示了一条新的工程路径:当模型足够快、足够便宜并能稳定调用工具时,它可以用更多轮验证和迭代完成复杂任务。Cyber 版本则说明同一基础模型可通过访问控制和安全策略服务更专业的高风险领域。
对用户而言,最合理的判断标准仍是单位任务结果:是否完成、是否可验证、用了多少时间与费用、失败后能否恢复。跑分、速度和低价都值得关注,但只有在受控工作流中转化为稳定交付,才是真正的生产力。










