“AI从哪里知道这个想法?”数学家追问OpenAI(ChatGPT开发公司)如何处理未发表研究
non-sofic groups
一类难以用有限对象近似的无限数学结构。
训练数据
用来改进人工智能的信息。
Lean证书
让电脑检查数学证明的记录。
发生了什么
OpenAI(ChatGPT开发公司)公布多项数学成果后,数学家Andreas Thom在Mastodon发文提出疑问:他和同事通过ChatGPT讨论的未发表研究,是否可能帮助了OpenAI的一项成果?这不是已经证明OpenAI滥用了他的研究,而是要求公司说明,私密对话会怎样被使用。该帖子在Hacker News上获得275 points和399 comments。这个数字只代表社区关注度,不代表说法已经被证实。
背景:OpenAI公布了什么
8月1日,OpenAI发布了十项数学和理论计算机科学成果。其中一项涉及non-sofic groups。简单说,它讨论的是一类难以用有限对象近似的无限数学结构。OpenAI表示,这些成果由内部版本的Astra模型完成。人类随后整理成论文,模型再用Lean证书把每个论证变成电脑可以检查的形式。于是,问题不只是谁写出了答案,也包括答案中的想法从哪里来。
Thom为什么会担心
在Thom公开的帖子中,他说自己和一位同事曾用ChatGPT讨论数学研究,还涉及与Gábor Kun合作的工作。他随后询问OpenAI研究人员:这些聊天是否进入训练数据?模型推理时是否能接触它们?根据Thom的说法,对方回答了AI能否直接找回某段聊天,却没有清楚回答聊天内容是否进入更大的模型改进流程。
关键区别:直接读取和间接影响
这两个问题不能混在一起。直接读取,指模型找到某段具体对话。间接影响,指对话里的信息可能帮助模型改进,即使模型之后没有逐字复述原文。OpenAI在9月的Navier–Stokes说明中表示,研究人员和AI在相关工作公开前没有看到外部研究,也没有使用特定用户数据来解决问题。同时,OpenAI写道,不能排除来自用户使用的去标识化数据帮助改进模型。去标识化数据在这里指去掉姓名等标记的数据,但这本身不能说明某个数学想法是否受到了影响。
已确认的事实
目前可以确认:OpenAI公开了十项成果;其中包括non-sofic groups;Thom公开讲述了自己的疑问;OpenAI在另一份公告中明确区分了“没有直接访问特定用户资料”和“不能排除去标识化资料帮助模型改进”;这件事也在Hacker News上受到关注。Hacker News的275 points和399 comments只显示热度,不能证明Thom的说法正确,也不能代表评论者的具体立场。
仍然不清楚的部分
公开资料没有回答,Thom的聊天是否真正进入训练数据,是否影响了那项成果,或相似想法是否已经来自公开数学。OpenAI的说法否认了“为解决问题直接读取特定用户资料”,但没有提供一份外部人士可以完整核对的模型数据记录。因此,现在不能断言研究被无授权使用,也不能断言间接影响绝对不存在。这里是对现有公开材料的谨慎判断,不是对任何一方的定罪。
接下来观察什么
接下来值得看三件事:OpenAI是否公布更具体的数据流向和保留规则;公司如何回应Thom的质疑;数学家和独立审阅者如何检查成果与贡献归属。对于研究者来说,真正需要的不是一句“AI没有直接看过”,而是能追溯的记录:哪些内容被使用,何时被使用,谁的想法应得到说明。这个事件的重要性,正在于它把AI数学能力之外的信任问题摆到了台前。
来源: Andreas Thom的帖子、OpenAI的8月发文、OpenAI的Navier–Stokes说明、Hacker News页面
未发表的数学想法去了哪里?OpenAI(制作ChatGPT的公司)被追问
📰 完整报道: “AI从哪里知道这个想法?”数学家追问OpenAI(ChatGPT开发公司)如何处理未发表研究
数学家Andreas Thom担心,未公开的数学想法可能影响了AI成果。
Astra
OpenAI使用的一种人工智能模型。
训练资料
人工智能用来学习和改进的信息。
Lean证书
电脑可以检查的证明记录。
💡 一句话总结
- 数学家Andreas Thom问:ChatGPT(会聊天的人工智能)听过的研究,会不会帮助OpenAI?
- OpenAI说,没有直接用特定用户资料解决Navier–Stokes问题。
- Hacker News(讨论技术的网站)有275 points和399 comments;热度不等于事实。
OpenAI(制作ChatGPT的人工智能公司)在8月公布了十项数学成果。 其中一项和non-sofic groups有关。 OpenAI说,Astra模型找到了这些结果。 人类整理了文章。 模型又用Lean证书检查证明。
Andreas Thom是一位数学家。 他说,自己和同事用ChatGPT讨论过数学想法。 这些想法当时还没有公开。 他于是询问OpenAI研究人员。 聊天有没有进入训练资料? AI做答案时有没有用到它们?
这两个问题不一样。 直接读取,是AI找到某段聊天。 间接影响,是聊天里的信息帮助AI变好。 OpenAI在Navier–Stokes说明中说,研究人员和AI没有在公开前看到外部研究。 OpenAI还说,没有用特定用户资料解决问题。 但它不能排除去掉姓名的资料帮助改进模型。
所以,现在不能说Thom的研究已经被无授权使用。 也不能说间接影响绝对不存在。 我们还不知道聊天是否进入训练资料。 也不知道它是否影响了那项成果。 公开数学中是否已有相同想法,也需要比较。
接下来要看OpenAI是否公布更清楚的数据记录。 还要看它如何回应Thom的说法。 数学家也需要检查成果和贡献归属。
💬 AI解出数学题时,功劳算谁的?
争论的核心是未发表的想法有没有被使用,以及真正做出重要工作的人是否得到承认。
- 证据可能还不够。它能说明有人和AI谈过这个问题,也在研究它,但不能说明AI独自找到了完整证明。一位评论者的自我申报称,这位数学家已经研究了约20年。
- 有人认为,AI把已有的想法和大量资料连起来,也可以是有用的研究协作。另一些人认为,人类合作者可以被明确署名和追责,所以模型prompt不一定等同于人类导师或同事的帮助。
- 如果私人研究讨论进入了模型的training data,而数学方法又非常专业,研究者可能会被AI实验室抢先取得成果。不过,也有人指出,没有展示具体被借用的方法,因此还不能直接断定抄袭。
- 一位评论者的自我申报称,6月29日关闭了训练使用选项,之后OpenAI说明会话没有用于训练。其他评论者担心数据可能以别的形式被使用,也指出普通用户条款和企业条款的承诺不同。
- AI帮助人们更快完成难题可能很有价值,但隐藏人类贡献会损害功劳、信任和数学人才的未来。评论者希望公开说明AI用了什么资料、人类做了什么。
这是评论数为399时的增长中(修订1)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
数学家Andreas Thom问:“AI怎么知道这个想法?”OpenAI(做ChatGPT的公司)
📰 完整报道: “AI从哪里知道这个想法?”数学家追问OpenAI(ChatGPT开发公司)如何处理未发表研究
Andreas Thom研究数学。OpenAI制作会聊天的ChatGPT。
ChatGPT
可以和人说话的人工智能。
Hacker News
大家讨论技术消息的网站。
OpenAI
制作ChatGPT的公司。
OpenAI公布了十个数学结果。 其中一个答案很难。 Andreas Thom有一些新想法。 这些想法还没有告诉大家。 他和同伴用ChatGPT聊过这些想法。 ChatGPT是会聊天的AI。 Thom问OpenAI两个问题。 AI有没有学到这些想法? AI做答案时用过它们吗? OpenAI说,没有直接看过外面的研究。 OpenAI也说,一些去掉名字的信息,可能让AI变好。 这不等于说Thom的想法被用了。 现在还没有答案。 这个故事在Hacker News上受关注。 Hacker News是讨论技术的网站。 它有275 points和399 comments。 这些数字只说明很多人看到了。 它们不能证明谁说得对。 我们要等更清楚的记录。
💬 AI是自己找到答案的吗?
大家想知道,AI是想出了新办法,还是用了人的办法把最后一步做完。
- 现在的故事还不能证明AI独自找到了证明。一位评论者的自我申报称,那位数学家已经研究这个问题约20年。
- AI把人们已有的想法连起来,可能会很有帮助。但如果人提供了重要想法,就应该得到功劳;prompt不一定和人类伙伴的帮助一样。
- 一位评论者的自我申报称,6月29日关闭了训练使用,但后来仍有人担心会话是否被使用。评论者还说,普通用户和企业得到的承诺并不相同。
- AI可以让数学研究更快。为了公平,大家希望知道AI用了哪些资料,以及人类研究者做了哪些工作。
这是评论数为399时的增长中(修订1)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 AI是独立发现了数学成果,还是抢先完成了别人的研究?
HN讨论的重点不只是AI是否解出了数学问题,还包括未发表研究是否可能被用于训练或推理、成果应归谁,以及研究者能否信任云端AI服务。评论者对证据强度和OpenAI的透明度都存在分歧。
这是评论数为399时的增长中(修订1)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。