九月刚开始,大模型密集发布。9月1日,Anthropic发布Claude Fable 5.1;9月2日,谷歌推出Gemini 3.8 Flash及网络安全版本3.8 Flash Cyber,几个小时后Meta发布Muse Spark 1.3。OpenAI已预告Astra即将推出,马斯克则表示xAI计划约十天后发布Grok 4.7。

跑分数据上,Gemini 3.8 Flash和Muse Spark 1.3已接近Claude Fable 5.1,价格则差了一个量级:三款模型每百万输出Token分别为3.75美元、4.25美元和50美元。不过跑分接近不等于全面追平,实际使用体验、最高能力和成熟度仍可能差距明显。只是过去只有高价前沿模型才能取得的成绩,正被价格更低的模型逼近。
两家实现低成本的路径不同。谷歌让模型“更努力”,遇到复杂任务时增加推理步骤、反复调用工具,用更多Token换取更好结果;Meta则称Muse Spark 1.3比上一代少用约25%的Token。谷歌的Flash系列六周内更新三次,Gemini 3.8 Flash距离上版仅三周。谷歌称其在软件工程、智能体任务等领域有提升,并通过长时间运行的智能体循环反复评估改进模型。Gemini 3.8 Flash优惠价与3.7相同,每百万输入Token 0.75美元、输出3.75美元;2027年起标准价调整为输入1.5美元、输出7.5美元。由于高努力档消耗Token增加,用户为单次任务付的总账可能变高。
同日发布的3.8 Flash Cyber面向网络安全,据谷歌称在漏洞发现基准上超过3.5 Flash Cyber,也超过一些规模更大的前沿模型。










