722篇手稿,372个成果族
10月6日,OpenAI在GitHub上公开发布了一批由其内部前沿模型生成的数学研究成果。仓库中共包含722篇数学手稿,按相关性归入372个“成果族”,覆盖数论、代数几何、理论计算机科学、数学物理等17个研究方向。
这是OpenAI迄今为止规模最大的一次数学成果发布。据OpenAI披露,整个评估过程中,该模型被投喂了约4000个研究问题,经过筛选和整理后,留下了这372个成果族。一个“成果族”通常包含一个主结果,以及配套的论证、推论或替代证明。
从学科分布来看,数量最多的是理论计算机科学(40族)、组合数学(37族)、代数与复几何(36族)和数论(31族),其后是概率与统计力学、微分几何、数学物理、算子代数等方向。
涉及哪些问题
仓库中出现的数学问题清单,包含了多个长期悬而未决的开放问题。据科技日报报道,成果涉及准黎曼猜想、希尔伯特第十问题、Mahler猜想、Kaplansky相关猜想等。华尔街日报指出,发布内容包含与三个尚未解决的千禧年大奖难题相关的结果,其中包括黎曼猜想。
其中最先在社交媒体上引发讨论的是编号003的“准黎曼猜想”。黎曼猜想断言黎曼zeta函数的所有非平凡零点都落在实部为1/2的直线上。数论学家退而求其次提出的“准黎曼猜想”,要求证明存在某个小于1的常数θ,使得实部大于θ的半平面内没有零点。OpenAI的模型给出的结论是θ=7/8,对zeta函数和所有狄利克雷L函数一致成立。罗格斯大学数学教授Alex Kontorovich在社交媒体上评论称:“如果这是人做出来的,那会是一枚毫无争议的菲尔兹奖。”
另一个被提及的成果是四维挂谷猜想,以及一些计算机算法的改进。此外,仓库还包含关于量子海森堡铁磁体和相对论Vlasov-Maxwell方程的工作。
验证方式:Lean形式化与分阶段披露
与手稿一同发布的,还有三类“证明工件”:Lean形式化证明、10份模型推理过程的精简摘要,以及计算量与尝试问题数的统计。
Lean是一种编程语言,允许计算机检查数学论证的逻辑步骤是否成立。据对仓库目录的统计,372个成果族中有235族附带了Lean形式化说明页,约占63%。OpenAI坦承,并非所有手稿都完成了形式化,未形式化的结果“可能存在问题”,团队会尽快修正并持续补充。
OpenAI表示,这次发布是与普林斯顿高等研究院的数学与人工智能独立咨询小组(AGMAI)磋商后完成的,借鉴了该小组的建议和公开推荐。仓库还附带了论文修订与引用的规范协议,每个手稿都有独立的引用块,所有早期版本都会保持公开。

算力消耗:平均约3小时ChatGPT Pro推理
OpenAI披露了这批成果的算力成本。绝大多数结果走的是同一套固定流程,平均每个结果消耗的算力约相当于3小时ChatGPT Pro的深度推理。
从手稿文件夹的日期来看,主体内容集中在9月23日至10月5日之间产出,其中9月23日和24日两天各产出了近200篇。OpenAI告诉《科学美国人》,几乎所有论文都是通过向单个AI智能体发出单次提示生成的。
有两个结果没有遵循标准流程:一个是黎曼zeta函数的无零点区域,其文稿经过了人工编辑以提升可读性;另一个是CM阿贝尔簇的霍奇猜想证明。
社区反应:兴奋与质疑并存
AGMAI在发布后发表声明称,这对数学界是一件“意义重大的事件”,“其影响远不止于个别成果本身,而是波及整个数学领域和数学界”。但该小组同时强调,其咨询角色“不构成对成果的背书”,“这次发布仅仅是人类理解和将这项工作融入数学知识体系的开始,而非结束”。
质疑同样存在。纽约大学数学家Tristan Buckmaster曾参与纳维-斯托克斯问题的研究,他对《纽约时报》表示,他不认为OpenAI对如此大量的一次性发布成果做了充分的尽职调查。MIT数学家Andrew Sutherland对《科学美国人》表示,在OpenAI发布模型、其他人能够重复这些结果之前,“任何关于用单个智能体一次性解决问题的说法都应被视为未经验证”。
值得注意的是,AGMAI在9月29日发布的指南中曾要求AI实验室停止在私有模型上测试高难度数学问题,理由是“使用专有内部模型进行数学研究,有可能创造一个两层体系,让实验室跑在整个领域前面”。OpenAI表示,它遵循了大部分建议,但有一个例外:它将继续在内部模型上测试前沿数学问题。
(素材来自:OpenAI 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
