GPT-6 Astra攻克五道悬而未决数学难题
IT时代网9月5日消息,OpenAI新旗舰模型GPT-6 Astra在数学领域交出一份意外答卷:在Epoch AI联合曼彻斯特大学发布的FrontierMath Erdos(FME)基准测试中,它攻克了5道人类悬而未决的数学难题,成为全场唯一交出有效答卷的大模型,GPT-5.6、Claude Fable 5.1等四款主流模型全部得0分。这项测试的严格之处在于题目全部选自没有标准答案的开放难题,杜绝了训练集背答案的可能。模型被要求输出Lean形式化证明,由内核自动核验对错,所有模型统一预算300美元、限时72小时。68道Erdos难题中,GPT-6 Astra在标准环节解决2道,放宽算力预算的追加实验中又攻克3道,其中包括Erdos本人18岁提出、自称人生第一个正经问题的1931年解离集猜想,以及极值图论中赫赫有名的Erdos-Sos猜想。这些题目数十年来困住无数顶尖数学家。五道成果里既有构造反例推翻旧猜想的,也有完整证明新命题的,难度非同一般。成本方面,五道题全部尝试合计消耗超22万美元算力,标准基准测试本身只花了约2万美元,按300美元一次、3%成功率折算,解出一道重要开放问题的期望成本约1万美元。该模型训练在美国德州Stargate超算基地完成,预训练动用超10万张GPU,也是OpenAI首次大规模让前代模型参与监督训练。不过论文同时指出局限:模型可能想出了正确思路却无法转换成Lean形式证明,基准也只考察解题,而数学研究同样看重提出新问题的能力。68道难题仍有63道未被解开,距离全面攻克高阶数学还有很长的路。

注:本文中包含AI辅助创作的内容。