🔥 HN 热议

Claude与36份科学手稿:计算变快后,谁来检查答案?

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
BootLoops(布特卢普斯)

帮助人工智能进行精确科学计算的开源工具箱。

研究手稿(yán jiū shǒu gǎo)

正式发表前的研究文章草稿。

同行评审(tóng háng píng shěn)

同一领域的专家检查研究是否可靠。

发生了什么

Anthropic(开发Claude的人工智能公司)在10月1日发表了一篇客座文章。哈佛大学物理学教授Matthew Schwartz说,他让Claude和BootLoops(帮助人工智能做精确科学计算的开源工具箱)一起工作。三个月里,他们推进了36份研究手稿,覆盖18个领域,并有19位人类合作者。题目来自约400个候选问题。

这里的“36份”不是36篇已经通过同行评审的论文。BootLoops的手稿页面还列出准备中和初步版本。这个故事也在Hacker News(技术新闻社区)受到关注。不过,分数和评论只代表关注度,不能证明结果正确。

背景

Schwartz之前曾把Claude Opus 4.5当作研究助手。他说,Claude曾在两周内帮助完成一篇理论物理论文,但他几乎要修改每一句话,还要把Claude从无关的方向拉回来。这一次,他改变了做法:不再要求人工智能像人类科学家那样工作,而是寻找适合当前人工智能能力的问题。

BootLoops把物理、数学、程序代码和论文中的方法放进同一套工具。它能反复进行计算,也能用高精度数字帮助别人检查结果。Schwartz把这类问题称为适合Claude的问题,因为人工智能特别擅长处理代码、公式和大量资料。

为什么重要

重点不是Claude独自写出了36篇论文,而是一种计算方法可以跨过学科边界。这个项目涉及生态学、遗传学、地质学、经济学、语言学、健康政策、宇宙学等领域。

Schwartz说,BootLoops完成了30个费曼积分。其中15个复现了已知结果,另外15个此前没有被计算出来。项目还分析了57亿对相邻基因变化,并处理了来自4,452篇经济学论文的复现资料。这些例子说明,人工智能可以快速搬运和组合计算方法。

但计算速度和科学判断不是一回事。哪些问题值得研究,结果是否真的重要,仍然需要人来判断。Schwartz说,在自己不熟悉的领域,他请相关专家帮助评价结果。人类专家不是只负责最后签字,他们还帮助改变研究问题的方向。

已确认的事实

目前可以直接确认的资料,主要是Anthropic的原文和BootLoops的手稿清单。这些页面列出了36份手稿、18个领域、19位合作者和约400个候选问题。清单说,人类已经阅读这些项目来检查准确性,但也标出了尚未充分检查的项目。

BootLoops网站还说明,项目得到Anthropic的资金支持,但BootLoops并不是Anthropic的项目。因此,现有资料能证明这是一个由Schwartz介绍的研究流程,不能直接证明36份手稿都是经过独立验证的科学突破。

仍然不知道什么

我们还不知道这些手稿中有多少能通过同行评审,有多少能被其他研究者独立复现,也不知道哪些结果会长期影响科学。跨学科研究尤其需要各领域专家检查假设、数据、图表和结论。

如果手稿数量快速增加,阅读和验证的工作也会增加。科学的速度变快,不会自动让科学更可靠。

接下来观察什么

接下来要看准备中的手稿是否变成正式论文,代码和数据能否让第三方重复实验,也要看不同领域的专家是否认可结论。作者贡献如何记录同样重要:谁提出问题,谁找到错误,谁解释结果,谁得到学术信用。

这不是人工智能取代科学的故事,而是科学分工正在变化的故事。人工智能可能承担更多计算,人类仍要选择问题、理解意义、验证答案,并公平分配贡献。

💬 与Claude完成的36篇论文:速度与验证的冲突

评论区争论的核心是:36篇论文和Claude的速度究竟代表科学进步,还是代表审查无法跟上的低质量论文激增。关于Claude的性能、成果和专家参与情况,主要来自作者的说明与评论者的解读;评论区没有独立证明这些论文是正确的。

  • 据评论,36篇论文横跨粒子物理以及临床试验、经济学、地质学等领域。一位前高能理论研究者称,其中大多数似乎不是物理学,并质疑一个人能否核查专业范围之外的内容;另一条评论则指出,许多论文有相关领域专家共同署名。
  • 按作者自述,Claude Opus 4.5的表现相当于一名优秀研究生,但速度约快20倍。同一说明也承认,人仍需逐句修改,阻止无关方向和死路,并在陌生领域请教专家;作者还称因此取得了实质进展。速度和成果没有在这些评论中得到独立验证。
  • 哈佛教授的头衔不能证明论文正确,网上强烈的反AI反应也不能证明论文错误。基本标准应是逐篇检查方法、证据和可重复性。不过也有人反驳说,当审查速度跟不上投稿量时,声誉仍可作为筛选垃圾投稿的实用信号。
  • 有人认为,只有专业人类能够理解内容,才算真正增加知识;也有人认为,只要科学方法和结果可以检验,即使人类不在每个环节中也能推进。实际使用这些结果的人仍需要理解输出,并用现实数据检查。
  • 有人担心AI会造成低质量论文的粗制滥造危机:论文增长快过审稿、复现和反驳。也有人建议把AI用于复现或证伪已有结果,而不是继续生成更多论文。回应论文和复现研究确实存在,但评论者认为总体并不常见。
  • AI可能在理论物理等部分任务中有用,例如从已知方程提出推广并建议实验;但幻觉和不同领域间能力不均仍是风险。评论区没有证明36篇论文全部正确。

这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Claude帮忙做科学,三个月出现36份手稿

📰 完整报道: Claude与36份科学手稿:计算变快后,谁来检查答案?

人工智能可以加快计算,但不能替人保证答案正确。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
BootLoops(布特卢普斯)

帮助人工智能计算和检查结果的开源工具箱。

研究手稿(yán jiū shǒu gǎo)

研究发布前的文章草稿。

同行评审(tóng háng píng shěn)

相关领域的专家检查研究。

💡 一句话总结

  • Claude帮助物理学家处理科学计算。
  • 三个月里出现了36份研究手稿。
  • 手稿仍要由人检查,不能直接当成新发现。

Anthropic(开发Claude的人工智能公司)发表了一篇相关报道。Matthew Schwartz是哈佛大学的物理学教授。他和Claude一起使用了BootLoops(帮助人工智能计算的开源工具箱)。

这项工作持续了三个月。它涉及18个科学领域,还有19位人类合作者。题目来自约400个候选问题。手稿就是准备发表的研究文章草稿。

BootLoops能把不同学科的计算办法放在一起。这样,Claude可以把一种办法带到另一个领域。比如,它处理了30个粒子物理计算。其中15个复现了已知结果,15个是以前没有算出的结果。

项目还分析了57亿对相邻基因变化。它也处理了4,452篇经济学研究的复现资料。这些数字来自Schwartz的报告,所以还需要其他专家继续检查。

BootLoops的清单里有初步版本和准备中的工作。研究手稿多,不等于科学结论都正确。专家要检查数据、计算步骤和最后的解释。

Hacker News(技术新闻社区)也讨论了这件事。分数和评论只说明很多人注意到它。它们不能证明研究一定正确。

这件事的重要问题是:人工智能能算得更快,但谁来选择值得研究的问题?谁来判断结果有没有意义?接下来要看手稿能否通过同行评审,也要看别人能否独立复现。

可以阅读Anthropic的原文和BootLoops的清单。

💬 AI做出36篇论文,是更快的科学还是更多错误?

评论区对于AI制作36篇论文究竟是在加快科学,还是在增加错误,意见不一。Claude的速度和成果是作者的自述,评论区没有独立验证。

  • 据评论,这些论文不只关于物理。一位物理研究者担心大多数内容超出作者的领域;另一位评论者说,许多论文有相关专家共同署名。
  • 作者自报Claude Opus 4.5约有优秀研究生20倍的速度,但人仍要逐句修改、拉回跑偏的方向,并向陌生领域的专家求助。
  • 不能只因哈佛头衔就相信,也不能只因使用AI就否定。要看每篇论文的证据和能否复现;有人认为声誉可以帮助人们从大量投稿中先筛选。
  • 有人要求人类理解每篇论文,也有人接受只要结果能够检验。AI也许能帮助理论研究,但会产生幻觉;评论者建议用它检查旧结果,而不只是制造新论文。

这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Claude帮忙做科学题

📰 完整报道: Claude与36份科学手稿:计算变快后,谁来检查答案?

出现了36份研究草稿。人还要检查它们。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Claude(克劳德)

帮助人回答问题和做计算的电脑程序。

BootLoops(布特卢普斯)

帮助计算的工具箱。

Anthropic(开发Claude的人工智能公司)做了Claude。 Claude是会帮忙计算的电脑。 Matthew Schwartz是哈佛的物理老师。 他请Claude帮忙做科学题。 他们用了BootLoops(帮忙计算的工具箱)。 三个月里有36份研究草稿。 这些草稿来自18种科学领域。 草稿还不是最后答案。 人要检查每个答案。 有些工作还在准备中。 Hacker News(技术新闻社区)也谈了这件事。 大家关注,不等于答案正确。 以后还要看专家怎么检查。 这来自Anthropic的文章和BootLoops的清单。

💬 用AI做很多论文,好不好?

评论区的人对用AI做很多研究论文有不同看法。

  • 这里有36篇论文,而且不只讲物理。有人说有专家帮忙,也有人觉得范围太大。
  • 作者说Claude快约20倍,但人还要改很多地方,也要问专家。这是作者自己的说法。
  • 重要的是检查论文,看看别人能不能得到一样的结果。AI可能帮忙,也可能让错误的论文变多;有人想让AI先帮忙检查旧研究。

这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源