🔥 HN 热议

OpenAI数学论文引发质疑:答案之外,还要让人看懂证明

约2分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
预印本(yù yìn běn)

正式发表前公开的研究论文。

Lean(lín)

帮助计算机检查数学证明步骤的语言。

选择公理(xuǎn zé gōng lǐ)

关于从许多组里各选一个东西的数学规则。

发生了什么

OpenAI(开发 ChatGPT 的人工智能公司)宣布了一项集合论研究结果。它讨论的是 Partition Principle(分割原理)与选择公理之间的关系。OpenAI的说法是,前者成立,并不意味着后者一定成立。公司公开了预印本,也公开了 Lean 代码。Lean是一种能让计算机检查证明步骤的语言。

数学家 Asaf Karagila 在 2026年10月8日的博客中批评了这份材料。他长期关注这个问题。需要先说明,这不是数学界已经形成的共同结论。Karagila只快速看了预印本,没有仔细检查庞大的 Lean 代码。因此,他的文章主要是专家的阅读意见,不是一份完整的独立审稿报告。

争议不只在答案

Karagila认为,论文写得不清楚,结构也很奇怪。有些术语用得不自然。有些定理的写法也不像这类论文通常会采用的方式。他还批评了参考资料。论文用了至少三份没有公开发表、没有同行评审的讲义。其中一份来自他自己。他认为,相关内容本来可以引用已经发表的论文。

这类批评不等于证明数学结论是错的。它指出的是另一个问题:别人能不能读懂并检查这项工作。数学论文需要让其他研究者看出证明的思路,发现可能的错误,并把结果用于下一步研究。若文章难以阅读,验证工作就会变慢。

为什么这件事重要

OpenAI的新闻材料把这类成果称为进展。公众和媒体却可能把它说成“ChatGPT解决了百年问题”。两种说法之间有距离。公司一次公开许多结果时,数学家必须判断哪些值得仔细阅读。若材料难懂,他们就要暂停自己的研究或学生指导,先承担大量整理和核查工作。

Karagila并没有否定所有人工智能用途。他说,人工智能可以帮助整理资料、制作图表或校对邮件。但数学界需要先决定一些规则:研究者是否要说明怎样使用人工智能?审稿人和编辑是否应看到重要的对话记录?作者本人到底贡献了什么,也需要更清楚的判断方法。

已经确认与仍未确认

目前可以确认的是,OpenAI公开了这份预印本和 Lean 材料,Karagila公开批评了论文的表达、结构和引用。还不能从这篇博客判断中心结论是否经得起更广泛的专家检查,也不能判断这些结果有多少真正的新想法。Lean能帮助检查形式化步骤,但它不会自动告诉读者证明为什么重要,更不会自动说明想法是否原创。

这篇文章在 Hacker News 上获得了196 points和296 comments。这个数字表示社区的关注程度,不是论文正确的证明。

接下来要看什么

接下来应看其他数学家能否独立读懂并复核这些结果。OpenAI是否会补充更清楚的解释,邀请相关领域专家改进文字和引用,也值得关注。人工智能或许能让数学结果出现得更快,但这次争议提醒人们:能产生答案,和能把答案变成共同知识,不是同一件事。

💬 谁来理解并核查 AI 生成的数学成果?

原文讨论 OpenAI 宣布划分原理不蕴含选择公理的事件[原文](https://karagila.org/2026/openai-pp/)。HN评论分成两派:一派把带有 Lean 形式证明的成果看作有用进展;另一派认为,难以阅读的批量发布把解释、引用和核查的负担转给了数学家。下面所有数字、性能和漏洞说法,都按评论者自述处理。

  • 批评者认为,Lean检查通过,并不自动说明人类理解了证明的含义和思路。数学家需要逐行梳理难读的文字,而新闻和公开声明可能在专家完成核查前就影响资助决定。
  • 支持者反驳说,如果形式化命题确实对应目标问题,而且 Lean 检查了证明,它可能比大多数人类数学论文拥有更强的依据。他们认为可读性和真伪是两回事,感兴趣的人可以继续研究。
  • 更广泛的批评是,数学不只是答案数据库,还需要连接先前研究、说明问题背景、清楚表达和可复现性。有评论者自述,模型和提示词没有公开,外界只有结果和计算时间,因此无法独立复现。
  • 对 AGMAI 建议的理解也有争议。一位评论者把它描述为数学家建议公开成果;另一位评论者则说,该建议并不支持用专有模型测试高级数学问题,并要求对已经产生的成果先查文献、正确署名,再改写成便于人类阅读的版本。
  • 有评论者自述,sub-n log n multiplication 的追踪记录中,OpenAI 的指标从1 - 1.63e-55开始,经过115次报告中的更新,达到自称的当前记录1 - 9.87e-5。支持者把这看作成果带动了新的共同研究;批评者则说,少数热心参与者并不能消除负担和激励机制问题。
  • 关于动机,一位评论者解释说,FrontierMath已经饱和,所以开放数学问题被用作替代评测;该评论者自述有4,000题中的372题产生了结果,因此评测仍未饱和。另一位评论者认为,这也可能是在从数学界免费取得核查劳动。
  • 可靠性同样存在争议。有评论者自述,一个 AI 辅助的 Collatz 猜想反例证明因 Lean 内核漏洞而无效;另一篇关于分裂阿贝尔八维簇上 Weil 类代数性的论文则因符号错误,使稳定化迹的抵消论证和后续两篇论文依赖的构造失效。另一位评论者反驳说,前一个例子不是 OpenAI 或主要实验室的成果,而且这些例子都没有附带 Lean 证明,因此比较范围仍有争议。

这是评论数为300时的增长中(修订2)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

OpenAI公布数学结果,专家提醒:解释也很重要

📰 完整报道: OpenAI数学论文引发质疑:答案之外,还要让人看懂证明

电脑可以很快找到结果,但人们仍要读懂并检查它。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
预印本(yù yìn běn)

正式发表前公开的论文。

Lean(lín)

帮助电脑检查证明步骤的语言。

Hacker News

一个讨论技术新闻的网站。

💡 一句话总结

  • OpenAI公布了一份数学研究材料。
  • 数学家认为,文章和引用不够清楚。
  • Hacker News很关注,但关注不代表正确。

发生了什么

OpenAI是一家人工智能公司。 它开发了ChatGPT。 它研究了Partition Principle。 这是一个很老的数学问题。 OpenAI说,这个原则成立,不一定说明选择公理成立。 公司还放出了预印本。 预印本就是还没有正式发表的论文。 公司也放出了Lean代码。 Lean可以帮助电脑检查证明步骤。

Asaf Karagila是一位研究集合论的数学家。他读了一部分材料。他说文章难懂,结构也不自然。他还发现,参考资料里有几份没有正式发表的讲义。他认为,那里可以引用更合适的正式论文。

为什么要在意

数学不是只报出一个答案。其他人还要看懂答案的路。这样才能发现错误,也才能继续研究。如果文章太难读,专家就要花很多时间整理它。人工智能出答案越快,阅读和检查可能越忙。

Karagila没有说人工智能完全没用。他认为,人工智能可以帮助整理资料、做图和改邮件。但研究者需要说明自己怎样用了人工智能。审稿人也可能需要看到重要的使用记录。这样,大家才知道谁做了什么。

还不能确定什么

Karagila没有仔细检查全部Lean代码。这篇文章也不是完整审稿报告。因此,我们还不知道数学结论能不能通过更多专家的检查。我们也不知道其中有多少真正的新想法。

Hacker News上有196 points和296 comments。它说明很多人注意到这件事。它不能证明论文一定正确。接下来,数学家会继续阅读、检查和解释这些材料。原文 讨论

💬 AI给出数学答案,就够了吗?

原文讨论 OpenAI 宣布划分原理不蕴含选择公理的事件[原文](https://karagila.org/2026/openai-pp/)。HN评论争论这到底是数学进展,还是缺少解释和核查的成果。数字和漏洞都是评论者自述。

  • 批评者说,Lean这个证明检查器通过了,也不代表人类明白证明在做什么。他们担心数学家要承担核查时间,而公开宣传已经先传播出去。
  • 支持者说,如果命题确实对应问题,而且 Lean 检查了证明,它可能比普通人类论文更可靠。想读的人可以继续研究,并没有人被正式强迫去读。
  • 另一种批评认为,数学不只有答案,还需要前人的研究、清楚的解释,以及别人能够重复结果。有评论者自述,模型和提示词没有公开,所以无法独立重复。
  • 关于 AGMAI,有人说数学家建议公开;也有人纠正说,他们并不支持用专有模型测试难题,而是要求对已有结果查文献、写清出处并改善说明。
  • 据评论者自述,sub-n log n multiplication 的记录更新了115次,指标从1 - 1.63e-55变成1 - 9.87e-5。支持者认为,这说明公开成果能带来新的研究。
  • 关于评测目的,有评论者自述4,000题中有372题产生结果,评测还没有饱和。其他评论者自述,AI辅助的 Collatz 反例证明曾因内核漏洞失效,也有符号错误;另有人反驳说,那些并不是 OpenAI 的 Lean 证明成果。

这是评论数为300时的增长中(修订2)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

AI写了数学纸张,但还要有人读懂

📰 完整报道: OpenAI数学论文引发质疑:答案之外,还要让人看懂证明

AI说出答案后,人们还要一起看看答案对不对。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Partition Principle

一个很老的数学问题的名字。

Lean(lín)

帮电脑检查数学步骤的东西。

Hacker News

一个讨论技术新闻的网站。

发生了什么?

OpenAI是一家人工智能公司。 它开发了ChatGPT。 它发了一篇数学文章。 文章说一个很老的问题有了新答案。 这个问题叫 Partition Principle。 OpenAI还发了 Lean 的记录。 Lean能帮电脑检查数学步骤。

Asaf Karagila是数学研究者。 他读了一部分文章。 他说文章不容易看懂。 他说有些资料名字选得不好。 但他没有说答案一定错。 他也没有检查全部电脑记录。

为什么要读懂?

数学答案不能只有一句话。 我们还要知道它怎样得到。 这样才能找到错误。 也能让下一个人继续做题。 AI能很快写出很多答案。 人还是要花时间检查。

大家为什么在说?

Hacker News是一个技术新闻网站。 很多人在那里看到了这篇文章。 这表示大家很感兴趣。 这不表示数学答案一定正确。 以后还要请更多数学家检查。 他们会看看答案能不能用。

原文 Hacker News

💬 谁来检查 AI 的数学?

原文讲的是 OpenAI 说划分原理不蕴含选择公理的事情[原文](https://karagila.org/2026/openai-pp/)。评论里既有人兴奋,也有人担心。数字和错误都是评论者自己说的。

  • 有人说,AI找到了很难的数学答案。但解释很难读,所以人们要花很久去检查。
  • 支持者说,Lean像一个认真检查答案的小帮手。批评者说,还要有清楚的解释,也要让别人能重复做一遍。
  • 关于 AGMAI,有人说数学家同意公开;也有人说,他们并不赞成这样测试难题,已经有的成果也应该先查资料、写出处、讲清楚。
  • 评论者自述,有一项记录更新了115次,还有4,000题中372题的评测说法。另一些评论者自述,AI数学里出现过漏洞和错误,所以人还是要检查。

这是评论数为300时的增长中(修订2)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源