停更七个半月后,多个 Google 相关账号宣布 Gemini 4 Argon 正式发布。官方未解释命名由来,只将测试期内部代号用于正式版。Argon 指第 18 号元素氩,与 Chrome(铬)形成对仗。该模型目前只通过 Fairwind 计划向少量网络安全合作伙伴开放,未公布全面公开时间,只称届时先向付费 API 用户和 Google AI Ultra 订阅者开放,普通订阅用户仍需等待。此前测试场流出的据称 Gemini 4 版本未被官方认领,也无法确认是否掺入 Fable 和 Astra,相关对比结果不太可信。

Gemini 4 Argon 发布:知识写作突出,编程表现不一

官方跑分显示,在 18 项测试中,Gemini 4 Argon 有 13 项领先。知识工作优势最大,在 Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 上领先其他模型两档,这两项分别涉及真实金融分析和律师工作。长上下文方面,在检验 256k—1M 上下文的 GraphWalks 中,领先其他旗舰模型超过 10%。其输出上限从上一代 6.4 万 token 提高到 100 万 token;官方称,模型有足够空间深入思考并在单次推理中生成数十万词元时,推理会获得新深度,能一次性解决棘手问题。

编程表现不稳定。在 DeepSWE v1.1 上,成绩为 77.9%,领先 GPT-6 Astra 和 Claude Opus 5.5 接近 4 个百分点;但在 FrontierSWE v2 和 Terminal-Bench 4.0 上垫底。可概括为知识/写作强于编程,编程强于终端。Arena.ai 盲评中,它在 Text Arena 排第一,在 Code Arena: WebDev 和 Agent Arena 只排第 8。

Artificial Analysis 测试中,Gemini 4 幻觉率只有 15%,在前沿模型中最低。有观点认为,过度优化 Agent 编程能力让部分前沿模型出现“不说人话”的情况,如 GPT-5.3 以来的疯狂分行和 Opus 4.7 的神秘黑话;编程能力不算突出的 Gemini 反而保留了文字审美,有助于写作。