9月21日,SpaceXAI发布Grok 4.7。新模型已进入xAI API、Grok Build和Cursor,并开始向GitHub Copilot用户开放。它支持50万token上下文窗口,可处理文本和图像,提供从low到xhigh四档推理强度。

Grok 4.7发布:与Grok Build配合才见提升,换旧框架未必更好

安全公司XBOW在50项漏洞测试中发现,Grok 4.7早期候选版接入原有框架时略逊于4.6;换到基于Grok Build的系统,结果才反转。两套工具结论相反,差别不只在模型是否更聪明,还在于Agent如何保存上下文、调用工具和失败重试。Grok 4.7偏爱短步骤、频繁获取反馈,Grok Build正按这种方式设计。按SpaceXAI说法,新模型采用更大基础模型,强化学习时间更长,训练任务也更偏重需要数小时完成的问题。

Artificial Analysis以xhigh档和high档测试Grok 4.7与4.6,两代分数不作直接比较。单看4.7,综合指数46分,在AA-Briefcase中为1657 Elo。代码Agent测试更能直接比较:Grok 4.7与Grok Build组合指数56分,比同样使用Grok Build和xhigh档的4.6高9分;三项子测试全部上升,Terminal-Bench从18%升至33%。这9分由模型和工具共同取得,公开数据还不能拆清各自贡献。

离开Grok Build,结果会变。XBOW把Grok 4.7早期版本接进原有漏洞利用框架,运行50项测试,每项重复10次。在固定迭代次数下,4.7略逊于4.6,不少任务要多跑几轮才能得到相同结果,token效率也没有明显优势。它喜欢发出简短终端命令,每走一步拿回结果再决定下一步,不太愿意一次写长脚本。换到基于Grok Build的系统后,等权平均下,使用4.6时典型运行找到42项真实问题,换成4.7后增至68项。Grok 4.7正在进入更多第三方Agent工具,GitHub Copilot正向个人和企业用户逐步开放。价格上,Grok 4.7延续上一代标准API价格:单次请求输入不满20万token时,每百万输入、缓存输入和输出token分别收费2美元、0.5美元和6美元;达到20万token后,三项价格分别升至4美元、1美元和12美元。第三方渠道Vercel AI Gateway也已接入。