暂无菜单项

Gemini 3.8 Flash发布:0.75美元输入、1M上下文,Cyber版专攻漏洞修复

发布于 更新于
10

谷歌把旗舰级推理与编程能力压进 Flash 价格带:Gemini 3.8 Flash 面向大众和开发者,Cyber 版本则只向受信任防御机构开放。

Google 正式发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者定位为面向大规模 Agent、软件工程和复杂知识工作的高性价比通用模型;后者专攻漏洞发现与自动修复,通过 Fairwind Program 向政府、关键基础设施运营方和软件维护者等受信任机构提供。

3.8 Flash 的入门价格为每百万输入 Token 0.75 美元、输出 3.75 美元,支持 100 万 Token 输入上下文、最长 6.4 万 Token 文本输出,并可接收文本、图片、音频、视频和 PDF。这个价格是限时入门价,将于 2026 年 12 月 31 日结束。

Gemini 3.8 Flash与Flash Cyber发布
Gemini 3.8 包含通用 Flash 与受限开放的 Flash Cyber 两个版本。

Gemini 3.8 Flash 核心规格一览

模型定位 编码、Agent、复杂推理与知识工作
输入模态 文本、图像、视频、音频、PDF
输出 文本,最长 64K Token
上下文 最高 1M Token
工具能力 函数调用、搜索、Computer Use
API 型号 gemini-3.8-flash
开放状态 正式可用(General availability)
Gemini 3.8 Flash开发者评价
开发者关注点主要集中在速度、成本和Agent执行能力。
Gemini 3.8 Flash模型能力展示
3.8 Flash 强调在低延迟和规模化条件下完成复杂工作流。

价格为什么重要:Flash 让多轮 Agent 循环更可负担

Gemini 3.8 Flash 在 2026 年底前的入门价是输入 0.75 美元/百万 Token、输出 3.75 美元/百万 Token。2027 年 1 月 1 日起,官方计划调整为输入 1.50 美元、输出 7.50 美元。无论按哪个价格,它的核心策略都是用较低单价支持更多推理步骤和工具调用。

谷歌表示,高 effort 模式下模型可能主动使用更多 Token,以换取更好的结果。因此“单价便宜”不必然等于“每个任务都便宜”。评估真实成本时,应同时统计输入长度、工具返回内容、重试次数、输出规模和任务成功率。对超长代码库或 Agent 工作流,单位任务成本比 Token 单价更有意义。

Gemini 3.8 Flash价格与智能表现
Gemini 3.8 Flash 试图在智能水平与任务成本之间形成新的平衡。
Gemini 3.8 Flash Intelligence Index评测
第三方智能指数可用于横向参考,但不能替代真实业务盲测。
Gemini 3.8 Flash成本性能前沿
在软件工程任务中,Flash 的优势来自性能、速度和价格的组合。

编程与长程 Agent:DeepSWE 是最值得关注的信号

Google 将 Gemini 3.8 Flash 定位为“最智能的工作马模型”,重点不是一次回答,而是端到端解决工程问题。官方材料显示,它在 DeepSWE v1.1 长周期软件工程评测中超过多数更大的前沿模型,同时保持更低任务成本;还支持函数调用、搜索和计算机操作,适合需要连续执行的 Agent。

模型页面展示的其他成绩包括 HLE-Verified 54.9%、Vals Finance Agent v2 61.4%。这些结果反映其多步骤推理和专业工作流潜力,但官方基准可能与企业仓库、依赖环境和验收标准不同。实际使用应设置测试、回滚、预算上限、权限范围和人工批准点。

Gemini 3.8 Flash生成速度对比
速度越快,Agent越能以较低等待成本进行验证和迭代。
Gemini 3.8 Flash DeepSWE成绩
DeepSWE关注复杂工程问题的端到端解决能力。
Gemini 3.8 Flash编程任务动态演示
编程Agent需要在生成、运行、报错和修复之间形成闭环。
Gemini 3.8 Flash软件工程案例
真实代码任务仍需依赖测试证据和人工代码审查。

所谓“RSI 一大步”,应该怎样理解

报道中把这次更新称为递归自我改进(Recursive Self-Improvement,RSI)的一大步,主要来自长期 Agent 循环会反复评估、验证和修正结果。Google 官方也提到,两款模型借助长时间 Agent 循环进行递归评估和改进。

但这不等于模型已经能够自主修改权重、独立训练下一代模型或实现失控式能力增长。更准确的描述是:低成本、高速度和更强工具调用,让模型在单个任务中进行更多轮“计划—执行—验证—修正”。这是工作流层面的自我修正,而非已经得到证明的通用递归自我进化。

Google DeepMind强化学习与后训练讨论
模型能力提升来自训练、后训练和Agent系统工程的共同作用。
Gemini 3.8 Flash Agent执行策略
额外推理步骤可以提高复杂任务质量,也会增加Token消耗。

基准争议:榜单领先不代表所有实战都领先

Gemini 3.8 Flash 在不同基准上的排名并不完全一致,这很正常。终端、代码仓库、金融、法律、通识推理和计算机操作测试衡量的是不同能力;同名基准的版本、提示词、工具环境和评审方式也可能不同。

尤其需要防止训练数据污染、针对公开题库优化以及把“高 effort 多次迭代”与其他模型的单次回答直接比较。更可靠的企业评测应使用未公开任务、统一工具、相同预算和盲评,并记录一次成功率、修复次数、总 Token、耗时和人工返工成本。

Gemini 3.8 Flash与其他模型基准争议
不同测试集和运行设置可能得出不同排名。
Gemini 3.8 Flash第三方模型对比
受限预览模型与正式可用模型也不应简单等同。
Gemini 3.8 Flash基准与实战差异
评测成绩需要结合任务难度、成本和可复现性解读。

为什么先发 Flash,而不是新的 Pro

Gemini 3.8 Flash 建立在 3.7 Flash 之上,是六周内的第三次 Flash 更新。Google 的公开定位强调规模化、响应速度和长程 Agent,而不是用“更大参数”作为唯一卖点。对于需要频繁调用工具和快速迭代的产品,小而快、每轮便宜的模型可能比单次推理更强但更慢的模型更具总成本优势。

关于未发布 Pro 候选版本、内部人员变动或下一代训练进度的说法,如果没有官方文件支持,只能作为行业传闻,不能当作已确认事实。可以确认的是,Google 仍在模型页面列出 Gemini 3.5 Pro “coming soon”,而 3.8 Flash 已正式可用。

Gemini 3.8 Flash产品节奏讨论
Flash 系列持续迭代,反映谷歌对规模化Agent工作负载的重视。

Gemini 3.8 Flash Cyber:受限开放的网络防御模型

Gemini 3.8 Flash Cyber 与通用版共享基础能力,但拥有更适合专业网络防御的安全策略。它通过 Fairwind Program 向受信任防御机构提供,不是所有用户都能在普通 Gemini 产品或 API 中直接选择。

Google 披露,Cyber 版在覆盖20种编程语言的内部漏洞发现测试中成功率超过70%;在 CWE-Bench 自动修复评测中 pass@1 为47.2%,接近领先前沿模型的47.8%。Chrome 安全团队称其生成的正确补丁数量是此前最佳大型商业模型的2.6倍;Google Cloud 漏洞研究团队还用它在不到两小时内发现一项关键基础漏洞。

这些数据说明低成本模型可以帮助防御团队扩大代码审计覆盖,但不能取代安全工程师。漏洞验证、补丁回归、供应链影响、披露流程与生产上线都需要人工负责;涉及攻击性任务时还必须遵守授权范围与法律要求。

Gemini 3.8 Flash Cyber漏洞检测与修复
Cyber 版优先强化漏洞发现和自动补丁,而非开放攻击能力。

如何使用 Gemini 3.8 Flash

  • 个人用户:可通过 Gemini App、Google Search AI Mode 等支持渠道使用。
  • 开发者:可在 Google AI Studio、Gemini API、Android Studio 和 Google Antigravity 中调用。
  • 企业:可通过 Gemini Enterprise Agent Platform 接入。
  • Cyber 用户:需申请 Fairwind Program,普通 API 账户不会自动获得权限。

站内已整理通用使用入口,可访问 Gemini 前台导航页。建议开发者在 2026 年底的入门价格期内完成任务成功率和总成本测试,并为 2027 年价格调整预留预算。

Gemini 3.8 Flash生成3D游戏案例
Google 展示了使用循环指令生成带谜题和环境贴图的3D游戏。
Gemini 3.8 Flash生成DOS版Google地图
模型可在单个工作流中组合代码、地图位置、导航和街景交互。

使用限制与风险清单

  • 模型可能产生幻觉,关键事实、代码和补丁必须验证。
  • 高 effort 可能使用更多 Token,并出现偶发变慢或超时。
  • 官方知识截止日期主要为2026年3月,部分领域可能只覆盖到2025年1月。
  • 非英语安全表现相较3.7 Flash略有回退,中文高风险场景应额外测试。
  • Cyber 版仅限受信任防御者,不能把官方演示理解为公开渗透测试工具。
  • 入门价格将在2026年底到期,长期产品需按2027年价格重新测算。

总结:速度与价格正在成为 Agent 智力的一部分

Gemini 3.8 Flash 的意义不是简单“用 Flash 打败所有旗舰”,而是展示了一条新的工程路径:当模型足够快、足够便宜并能稳定调用工具时,它可以用更多轮验证和迭代完成复杂任务。Cyber 版本则说明同一基础模型可通过访问控制和安全策略服务更专业的高风险领域。

对用户而言,最合理的判断标准仍是单位任务结果:是否完成、是否可验证、用了多少时间与费用、失败后能否恢复。跑分、速度和低价都值得关注,但只有在受控工作流中转化为稳定交付,才是真正的生产力。

常见问题(FAQ)

Gemini 3.8 Flash 是什么?
它是Google面向编码、Agent、复杂推理和知识工作的通用Flash模型,支持文本、图片、视频、音频和PDF输入,并提供函数调用、搜索与计算机操作。
Gemini 3.8 Flash 的上下文有多长?
官方模型信息显示,输入上下文最高为100万Token,文本输出最长为6.4万Token。
Gemini 3.8 Flash API 价格是多少?
2026年12月31日前的入门价为每百万输入Token 0.75美元、输出3.75美元;从2027年1月1日起计划调整为输入1.50美元、输出7.50美元。
Gemini 3.8 Flash 的 API 型号是什么?
开发者在Gemini API中使用的型号为 gemini-3.8-flash,可通过Google AI Studio等官方渠道接入。
Gemini 3.8 Flash Cyber 可以公开使用吗?
不可以直接公开使用。Cyber版通过Fairwind Program向政府、关键基础设施运营方、软件维护者等受信任防御机构提供。
Gemini 3.8 Flash Cyber 主要能做什么?
它面向防御性网络安全工作,重点是自主漏洞发现、跨语言代码审计与自动补丁生成,而不是向普通用户开放攻击能力。
Gemini 3.8 Flash 是否实现了递归自我改进?
没有证据表明它能自主修改权重或训练下一代模型。更准确的说法是,长程Agent循环会在单个任务中反复计划、执行、验证和修正。
Gemini 3.8 Flash 有哪些限制?
它仍可能产生幻觉,高努力等级可能消耗更多Token并偶发变慢或超时;官方还披露非英语安全表现相较3.7 Flash略有回退,关键任务必须验证。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材