谷歌近日发布了 Gemini 3.8 Flash,这是六周内推出的第三款 Flash 系列模型。谷歌方面称,该模型面向长程软件工程、自主 Agent 和复杂企业工作流,目标是编写和修改大型项目、反复调用工具,并能独立完成持续数小时的复杂任务。

Gemini 3.8 Flash 上线,性能提升但评价不一

从官方公布的跑分看,Gemini 3.8 Flash 在多项测试中表现不错。例如,在长程软件工程测试 DeepSWE v1.1 中得分 71.0%,高于 3.7 Flash 的 65.3%;在 HLE-Verified 测试中得分 54.9%,略高于 Claude Opus 5。复杂图表理解测试 CharXiv Reasoning 为 86.2%,长视频理解测试 LVBench 为 87.8%。价格方面,3.8 Flash 与 3.7 Flash 一致,每百万 Token 输入 0.75 美元、输出 3.75 美元,这一优惠价格将持续到 2026 年底。

不过,社区反馈和一些简单测试显示,实际体验可能与官方跑分存在差距。有观点认为,3.8 Flash 的性能提升部分来自“更加努力”,即面对复杂问题时执行更多推理步骤、反复调用工具并自我检查,这可能导致 Token 消耗比 3.7 Flash 更多。谷歌也建议,若看重计算效率,可以降低推理档位或继续使用 3.7 Flash。

与 3.8 Flash 同时发布的还有 3.8 Flash Cyber,专门用于漏洞发现与修复。谷歌称,在覆盖 20 种编程语言的内部测试中,其漏洞发现成功率超过 70%。该模型仅通过 Fairwind Program 提供。