OpenAI近日举行媒体吹风会,正式发布GPT-6 Astra模型。OpenAI总裁Greg Brockman在介绍时表示,如果将来的某一天要追溯AGI在何时诞生,答案可能是这段时间,甚至可能就是这款模型。他还称Astra是当前全球最智能、最符合人类意图的模型。

OpenAI发布GPT-6 Astra:多项测试高分,定价同步上调

测试成绩亮眼,有些项目接近满分

OpenAI公布的数据显示,Astra在研究级数学测试FrontierMath Tier 4和科学知识测试GPQA Diamond中的得分分别为97.6%和96%。它在中长程软件工程测试DeepSWE、CAD绘图测试BenchCAD和漏洞利用测试ExploitBench中也分别得到74.1%、95.9%和100%的成绩。

OpenAI还专门提到了ARC-AGI-3测试的结果:99.9%。这项测试要求模型在没有任何规则说明的陌生环境中,通过观察互动推断规则并规划行动。今年3月刚发布时,最强AI模型在该项测试中的得分只有0.51%,而Astra在保留推理与压缩上下文的特定框架下取得了接近满分的表现。

上下文窗口更大,价格同步提高

根据官方公开的规格,Astra支持105万token的上下文窗口,单次最高可输出12.8万token,知识截止时间为2026年4月30日,提供low至max共五档推理强度。

定价方面,标准模式下每百万输入token收取10美元,输出token每百万收取50美元。输入超过27.2万token后,整次请求的输入和缓存价格翻倍,输出价格升至75美元。快速模式收费为标准模式的两倍。这些定价与Anthropic刚发布的Fable 5.1相当。

在开放节奏上,Astra首先面向少数可信合作企业开放,ChatGPT付费会员和API用户将在未来几天内逐步获得使用权限。此外还有一个涉及最高级网络攻击能力的版本,仅提供给网络防御机构。

第三方评测得分相对温和

在Artificial Analysis的通用智能测试Intelligence Index v4.1.1中,Astra max的成绩为61分,与GPT-5.6 Sol max持平,低于Fable 5.1的66分、Opus 5的63分和Muse Spark 1.3的62分。部分提前获得测试资格的开发者反映,Astra在通用智能方面并不算遥遥领先,但其环境理解与操作能力比较突出,生成结果质量不错。