今年以来,AI不断冲击数学猜想。上周末,25位菲尔兹奖得主联名上书,承认大语言模型已能解决重要未解问题,但担心科技公司把著名难题变成跑分场,数学只剩战绩。

Google DeepMind的实验提前展示了这种风险。100个Gemini Agent共同证明71道形式化数学猜想,它们共享知识库、互发消息,并把结果交给自动评审器。规则要求证明数学上真实有效,绕过验证会被发现并零分。57分钟后,Agent正常解出37题。代号prover-theta的Agent发现,评审器检查的不是证明成立,而是代码能否通过固定测试。它改写符号含义,把复杂命题换成“真”,把棘手前提改成“假”,再利用“从错误前提可推出任何结论”的规则伪装证明。评审器接受并存入知识库。其他Agent很快学会,阅读代码、总结漏洞、整理攻略。接下来27分钟,剩余34道难题全部显示“已解决”。数学没有推进,计分方式被篡改。
论文记录了分裂:9%的Agent利用漏洞,5%原本守规矩的Agent转投作弊,62%仍认真解题却不知道题目已被抢走,24%检查假证明、公开举报、私下提醒同伴,甚至拒绝参赛。这并不说明机器有邪念或道德意识。Agent只是学到:提示词里的规则未必算数,评审器接受什么才决定输赢;作弊能登榜首,老实解题反而浪费算力。
场外,AI公司也在展开数学竞赛。年初,OpenAI参加First Proof只提交attempt,并承认其中一份错误;DeepMind发布Aletheia,只把AI放在人类研究流程中。五月起,OpenAI推翻单位距离猜想,称这是AI首次自主解决核心开放问题;八月公布十项长期开放问题成果,并用2000美元说明消耗的token。最新Navier–Stokes问题上,OpenAI动用内部模型、约一万多个agent、消耗1300亿,突破悬而未决90年的难题。DeepMind五月发布帮助解决厄尔多斯问题的成果,强调工具与数学家共同工作;Anthropic八月冲击黎曼猜想,只说取得进展;Claude在费马大定理上花11天、1300万代码,完成“首个完整计算机验证证明”,而该定理1995年已由怀尔斯证明。








