⚡ 猫叔的AI资讯雷达
研究模型

Epoch 未解数学题库扩至 50 题,AI 再攻克两道

Epoch AI 将 FrontierMath 开放问题集扩充到 50 道真实未解研究题,并新记录两项由 AI 取得的解答,均属中间的「中等有趣」档位;同一次更新中另有三道题被移除。

Epoch AI 更新了 FrontierMath: Open Problems——这套题库收录的是人类研究者至今仍未解决的数学问题。此次更新将题目数量扩充至 50 道,并新记录两项归功于 AI 系统的解答。两者都落在 Epoch 所称的「中等有趣」档位,即由数学家编辑委员会参与维护的显著性分级中的中间层。

新攻克的问题之一,是在 8、9、10 个符号上构造出比现有最优结果更短的超排列(superpermutation)。Epoch 表示,AI 系统在过去一周内做到了这一点,且该更优构造目前仍然成立。另一道题要求找出有理数域上一条亏格 2 曲线,其上带有素数阶不低于 31 的有理挠点;Epoch 指出,人类数学家此前其实已经找到过这样的曲线,因此这项 AI 结果作为「新发现」的成分要打折看。

就整套题库而言,Epoch 目前共标记三道题为已解决:除上述两道外,还有一道关于 Q₂ 的绝对伽罗瓦群表示的题目,它位于更高一档的「扎实结果」层。再往上的「重大进展」与「突破」两档,至今无一被攻克。

同一次更新中,Epoch 还从题库里移除了三道题。其中两道被移除是因为验证器无法可靠判定提交的解答是否正确——一道关于构造具有大量奇点的曲面,另一道关于判定纽结的解结数是否为 1 的算法。第三道则因未达到这套题集应有的最低显著性门槛而被剔除。这种看似例行的整理,也无意间承认了一件难事:当足够能干的求解器被对准之后,要让一套固定的「未解问题」集合既保持未解、又保持有意义且可靠可判,本身极为困难。

这种设计张力恰恰是题库的意义所在。与 FrontierMath 那些已有答案、只是未公开发表的分级题目不同,Open Problems 没有参考答案,一项解答是否成立,要由数学共同体是否接受来判定。这让它成为一个吞吐极低、进展缓慢的信号源,但也是无法靠记忆刷分、不会被训练数据污染的信号,且每道被解决的题目都是一次性消耗。

为何重要

绝大多数「AI 做出数学发现」的说法都以厂商公告的形式出现,缺少独立裁决。Epoch 的题库提供了一份中立、由数学家评审的台账:究竟哪些研究问题真的被攻下、各自分量如何——包括本批中一项其实早有人类解答这样的降温细节。当各实验室越来越多地把自主科研能力当作卖点时,一份能区分真正首创与重复发现的公开登记册,正是买方与政策制定者可以拿来对照的东西。

信源