Claude与36份科学手稿:计算变快后,谁来检查答案?
BootLoops(布特卢普斯)
帮助人工智能进行精确科学计算的开源工具箱。
研究手稿(yán jiū shǒu gǎo)
正式发表前的研究文章草稿。
同行评审(tóng háng píng shěn)
同一领域的专家检查研究是否可靠。
发生了什么
Anthropic(开发Claude的人工智能公司)在10月1日发表了一篇客座文章。哈佛大学物理学教授Matthew Schwartz说,他让Claude和BootLoops(帮助人工智能做精确科学计算的开源工具箱)一起工作。三个月里,他们推进了36份研究手稿,覆盖18个领域,并有19位人类合作者。题目来自约400个候选问题。
这里的“36份”不是36篇已经通过同行评审的论文。BootLoops的手稿页面还列出准备中和初步版本。这个故事也在Hacker News(技术新闻社区)受到关注。不过,分数和评论只代表关注度,不能证明结果正确。
背景
Schwartz之前曾把Claude Opus 4.5当作研究助手。他说,Claude曾在两周内帮助完成一篇理论物理论文,但他几乎要修改每一句话,还要把Claude从无关的方向拉回来。这一次,他改变了做法:不再要求人工智能像人类科学家那样工作,而是寻找适合当前人工智能能力的问题。
BootLoops把物理、数学、程序代码和论文中的方法放进同一套工具。它能反复进行计算,也能用高精度数字帮助别人检查结果。Schwartz把这类问题称为适合Claude的问题,因为人工智能特别擅长处理代码、公式和大量资料。
为什么重要
重点不是Claude独自写出了36篇论文,而是一种计算方法可以跨过学科边界。这个项目涉及生态学、遗传学、地质学、经济学、语言学、健康政策、宇宙学等领域。
Schwartz说,BootLoops完成了30个费曼积分。其中15个复现了已知结果,另外15个此前没有被计算出来。项目还分析了57亿对相邻基因变化,并处理了来自4,452篇经济学论文的复现资料。这些例子说明,人工智能可以快速搬运和组合计算方法。
但计算速度和科学判断不是一回事。哪些问题值得研究,结果是否真的重要,仍然需要人来判断。Schwartz说,在自己不熟悉的领域,他请相关专家帮助评价结果。人类专家不是只负责最后签字,他们还帮助改变研究问题的方向。
已确认的事实
目前可以直接确认的资料,主要是Anthropic的原文和BootLoops的手稿清单。这些页面列出了36份手稿、18个领域、19位合作者和约400个候选问题。清单说,人类已经阅读这些项目来检查准确性,但也标出了尚未充分检查的项目。
BootLoops网站还说明,项目得到Anthropic的资金支持,但BootLoops并不是Anthropic的项目。因此,现有资料能证明这是一个由Schwartz介绍的研究流程,不能直接证明36份手稿都是经过独立验证的科学突破。
仍然不知道什么
我们还不知道这些手稿中有多少能通过同行评审,有多少能被其他研究者独立复现,也不知道哪些结果会长期影响科学。跨学科研究尤其需要各领域专家检查假设、数据、图表和结论。
如果手稿数量快速增加,阅读和验证的工作也会增加。科学的速度变快,不会自动让科学更可靠。
接下来观察什么
接下来要看准备中的手稿是否变成正式论文,代码和数据能否让第三方重复实验,也要看不同领域的专家是否认可结论。作者贡献如何记录同样重要:谁提出问题,谁找到错误,谁解释结果,谁得到学术信用。
这不是人工智能取代科学的故事,而是科学分工正在变化的故事。人工智能可能承担更多计算,人类仍要选择问题、理解意义、验证答案,并公平分配贡献。
Claude帮忙做科学,三个月出现36份手稿
📰 完整报道: Claude与36份科学手稿:计算变快后,谁来检查答案?
人工智能可以加快计算,但不能替人保证答案正确。
BootLoops(布特卢普斯)
帮助人工智能计算和检查结果的开源工具箱。
研究手稿(yán jiū shǒu gǎo)
研究发布前的文章草稿。
同行评审(tóng háng píng shěn)
相关领域的专家检查研究。
💡 一句话总结
- Claude帮助物理学家处理科学计算。
- 三个月里出现了36份研究手稿。
- 手稿仍要由人检查,不能直接当成新发现。
Anthropic(开发Claude的人工智能公司)发表了一篇相关报道。Matthew Schwartz是哈佛大学的物理学教授。他和Claude一起使用了BootLoops(帮助人工智能计算的开源工具箱)。
这项工作持续了三个月。它涉及18个科学领域,还有19位人类合作者。题目来自约400个候选问题。手稿就是准备发表的研究文章草稿。
BootLoops能把不同学科的计算办法放在一起。这样,Claude可以把一种办法带到另一个领域。比如,它处理了30个粒子物理计算。其中15个复现了已知结果,15个是以前没有算出的结果。
项目还分析了57亿对相邻基因变化。它也处理了4,452篇经济学研究的复现资料。这些数字来自Schwartz的报告,所以还需要其他专家继续检查。
BootLoops的清单里有初步版本和准备中的工作。研究手稿多,不等于科学结论都正确。专家要检查数据、计算步骤和最后的解释。
Hacker News(技术新闻社区)也讨论了这件事。分数和评论只说明很多人注意到它。它们不能证明研究一定正确。
这件事的重要问题是:人工智能能算得更快,但谁来选择值得研究的问题?谁来判断结果有没有意义?接下来要看手稿能否通过同行评审,也要看别人能否独立复现。
可以阅读Anthropic的原文和BootLoops的清单。
💬 AI做出36篇论文,是更快的科学还是更多错误?
评论区对于AI制作36篇论文究竟是在加快科学,还是在增加错误,意见不一。Claude的速度和成果是作者的自述,评论区没有独立验证。
- 据评论,这些论文不只关于物理。一位物理研究者担心大多数内容超出作者的领域;另一位评论者说,许多论文有相关专家共同署名。
- 作者自报Claude Opus 4.5约有优秀研究生20倍的速度,但人仍要逐句修改、拉回跑偏的方向,并向陌生领域的专家求助。
- 不能只因哈佛头衔就相信,也不能只因使用AI就否定。要看每篇论文的证据和能否复现;有人认为声誉可以帮助人们从大量投稿中先筛选。
- 有人要求人类理解每篇论文,也有人接受只要结果能够检验。AI也许能帮助理论研究,但会产生幻觉;评论者建议用它检查旧结果,而不只是制造新论文。
这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。
Claude帮忙做科学题
📰 完整报道: Claude与36份科学手稿:计算变快后,谁来检查答案?
出现了36份研究草稿。人还要检查它们。
Claude(克劳德)
帮助人回答问题和做计算的电脑程序。
BootLoops(布特卢普斯)
帮助计算的工具箱。
Anthropic(开发Claude的人工智能公司)做了Claude。 Claude是会帮忙计算的电脑。 Matthew Schwartz是哈佛的物理老师。 他请Claude帮忙做科学题。 他们用了BootLoops(帮忙计算的工具箱)。 三个月里有36份研究草稿。 这些草稿来自18种科学领域。 草稿还不是最后答案。 人要检查每个答案。 有些工作还在准备中。 Hacker News(技术新闻社区)也谈了这件事。 大家关注,不等于答案正确。 以后还要看专家怎么检查。 这来自Anthropic的文章和BootLoops的清单。
💬 用AI做很多论文,好不好?
评论区的人对用AI做很多研究论文有不同看法。
- 这里有36篇论文,而且不只讲物理。有人说有专家帮忙,也有人觉得范围太大。
- 作者说Claude快约20倍,但人还要改很多地方,也要问专家。这是作者自己的说法。
- 重要的是检查论文,看看别人能不能得到一样的结果。AI可能帮忙,也可能让错误的论文变多;有人想让AI先帮忙检查旧研究。
这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 与Claude完成的36篇论文:速度与验证的冲突
评论区争论的核心是:36篇论文和Claude的速度究竟代表科学进步,还是代表审查无法跟上的低质量论文激增。关于Claude的性能、成果和专家参与情况,主要来自作者的说明与评论者的解读;评论区没有独立证明这些论文是正确的。
这是评论数为73时的初期(修订1)。获取73条,并从整体抽取73条总结。内容属于HN用户自述,并非编辑部核实的事实。