9月1日,Anthropic发布了Claude Fable 5.1和Mythos 5.1,两款模型共用同一个底层模型,重点提升长时间智能体、编程和科研任务的能力。官方测试显示,科研类终端任务成绩比上一代翻了一倍多,办公自动化效率提高了约八成。

Claude Fable 5.1与Mythos 5.1发布:缓存价格降了,任务总成本未必降

价格方面,标准输入输出价格保持不变,缓存读取价格则从每百万Token 1美元降至0.25美元,降幅达75%。按照Anthropic的估算,典型工作负载成本能降低约25%,高度智能体化的任务最多可降低约45%。不过,第三方机构Artificial Analysis测得的数字并不完全一致:在最高努力档下,Fable 5.1的单任务成本反而比上一代高出20%。缓存读取虽然便宜了,但模型输出量增加,总账单反而可能更高。

Anthropic还公开了几个早期案例来说明长任务能力。Millennium曾遇到一个大约每运行100万次才出现一次的软件崩溃,内部团队排查了四五年都没有找到原因;测试中Fable 5.1通过拆解外部供应商的软件库并与崩溃产生的core dump比对,最终定位到外部库中的漏洞。Ramp在一次无人值守的机器学习任务中让模型连续运行了38小时,模型先发现实验数据存在标签问题,修正后启动了六组并行实验,随后返回结果和下一步建议。Browserbase则在内部浏览器智能体测试中记录到,Fable 5.1完成了82%的任务,Fable 5为57%,Opus 5为74%。这些案例也提示,模型仍有接近五分之一的任务无法完成,用户不能完全放弃验收。

沃顿商学院教授伊森·莫利克在早期体验后表示,Fable 5.1在需要判断和取舍的长时间任务里取得了实际进步,但一些带有明显”Claudish”特征的表现依然存在。模型能干得更久,也意味着单次运行会消耗更多上下文、工具调用和输出Token,能力提升之后,成本问题反而成了新的门槛。