Google DeepMind 发布了 Gemini 3.8 系列模型,包含通用版 Gemini 3.8 Flash 和网络安全专用版 Gemini 3.8 Flash Cyber。这是该团队六周内的第三次 Flash 版本发布,距上一代 3.7 Flash 仅三周。两个变体共享同一基础能力,并通过长时间运行的智能体循环递归评估和优化底层模型。
3.8 Flash:长周期编程与自主智能体
据 Google DeepMind 介绍,3.8 Flash 在保持 3.7 Flash 同等速度和成本的前提下,在软件工程、智能体任务和关键多步推理方面取得显著进步。当前入门价格为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
在 DeepSWE v1.1(长周期软件工程)基准上,3.8 Flash 能够以较低成本端到端自主解决复杂工程问题,表现优于多数更大规模的前沿模型。在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等需要高级分析与报告的专业领域基准中,它同样超越了 3.7 Flash 及其他前沿模型。HLE-Verified 测试得分为 54.9%,覆盖 STEM、人文和专业领域的多步推理。
这些性能提升来自核心设计选择:3.8 Flash 在复杂任务上会执行更多推理步骤并迭代调用工具。在较高努力级别下,模型可能消耗更多 token 以最大化性能。对于以计算效率为首要约束的场景,开发者可使用较低努力级别减少 token 开销,或继续使用仍受完全支持的 3.7 Flash。
官方展示了多个由 3.8 Flash 生成的应用示例,包括在 Google Antigravity 中通过单条提示构建可玩的 DOS 版地图应用、利用美国地质调查局真实数据集生成地形图,以及在 AI Studio 中生成支持分层拆解的硬件三维可视化组件。
3.8 Flash Cyber:漏洞发现与自动修补
3.8 Flash Cyber 通过新推出的 Fairwind Program 向可信防御者提供访问,具备前沿级漏洞检测和自动修补能力。
在行业标准漏洞发现基准 CyberGym 上,3.8 Flash Cyber 的表现超越 3.5 Flash Cyber 及更大规模的前沿模型。在一项涵盖 20 种编程语言复杂代码库的内部综合基准中,其漏洞发现成功率超过 70%。
在修补能力方面,Collinear 运行的外部基准 CWE-Bench 显示,3.8 Flash Cyber 的 pass@1 为 47.2%,接近领先前沿模型的 47.8%,但成本显著更低。该版本优先投入漏洞修复而非攻击性利用能力。
内部部署与安全机制
Google 已在内部使用 3.8 Flash Cyber 保护代码。Chrome 安全团队表示,该模型生成的正确补丁数量是更大规模商用模型的 2.6 倍。Wiz 的内部渗透测试基准显示,其召回率提高 7.5% 至 9.7%,成本降低 2.3 至 5.2 倍。云漏洞研究团队借助该模型在两小时内发现了一个通常需要数月研究的关键基础漏洞。
安全方面,3.8 Flash 按照 Frontier Safety Framework 内置了针对化学、生物、放射性和核(CBRN)及网络攻击滥用的防护措施。3.8 Flash Cyber 采用更宽松的缓解策略,因此仅限需要全面网络能力的可信防御者使用。此外,Gray Swan 的测量结果显示,3.8 系列在提示注入鲁棒性上有显著提升。
获取方式与定价
开发者可通过 Gemini API、AI Studio、Android Studio、Stitch 或 Antigravity 使用 3.8 Flash;企业用户可通过 Gemini Enterprise 访问;消费者端面向 AI Pro 和 Ultra 订阅者开放,覆盖 Gemini 应用、Search AI Mode 和 Sheets。
3.8 Flash Cyber 通过 Fairwind Program 优先向政府机构、关键基础设施运营商和软件维护者开放申请。当前入门价格有效期至 2026 年 12 月 31 日,自 2027 年 1 月 1 日起调整为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元。
