Google 宣布推出新一代前沿模型 Gemini 4 Argon,填补了自 2025 年 11 月 Gemini 3 以来长达 10 个月的旗舰更新空窗期。与此前自身 6.4 万 Token 的上限以及竞品(如 OpenAI GPT-6 Astra 与 Anthropic Claude Opus 5.5)约 12.8 万 Token 的常规基准相比,Argon 将输出上限大幅推高至 100 万 Token。这一输出规模的跃升,核心机制在于支持模型在单次推理中端到端处理复杂工程,无需将长周期任务切分为多次提示词。
据 Google 披露的官方测试与内部实践,Argon 在真实世界软件工程测试 DeepSWE v1.1 中得分为 77.9%,自动化基准 AutomationBench 为 51.3%,漏洞修复基准 CWE-bench v1 为 68%;内部更被用于将逾 80 万行的 Fuchsia OS Zircon 内核等 C/C++ 代码库迁移至 Rust,并在 libgav1 视频解码项目中通过替换 SIMD 代码取得 2.7 倍提速,以及优化数据中心内存与量子算法。需要明确的是,这些表现均属厂商自测数据,具体实验条件尚未完全公开,尚不能证明在外部任意代码库中均能达成同等效果。
在网络安全应用中,网络安全公司 Wiz 借助 Argon 在医疗软件中发现了既有模型遗漏的敏感个人信息漏洞。为释放防御分析效能,Google 向特定受信任防御者及内部团队提供了未加装网络安全护栏的版本,并正在参与美国政府针对发布前模型访问的自愿审查程序。目前该模型尚未对公众开放,这种仅向受信任防御圈层提供高风险无护栏模型的准入限制,在防范生成能力滥用的同时也引发了部分订阅用户与个人开发者关于“诱饵替换”策略的不满。
在商业化与可用性层面,Google 为 Argon 制定了每 100 万输入 Token 2 美元、输出 10 美元(缓存享受 95% 折扣)的初始定价。然而,该模型当前的生产力价值兑现仍受制于多项未决边界:Google 官方尚未公布其输入上下文窗口大小,亦未确立面向普通开发者与企业客户全面开放的时间表,其自测基准与迁移成效仍有待第三方独立评测的实际复现。

