🤖 AI

AI学会了新闻,却可能让新闻变弱?法庭文件揭开矛盾

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
抓取(zhuāqǔ)

让程序自动收集网页内容。

合理使用(hélǐ shǐyòng)

在一些条件下,可以不先获得许可使用作品。

付费墙(fùfèi qiáng)

需要先付钱才能阅读内容的限制。

发生了什么

OpenAI(制作ChatGPT的AI公司)和Microsoft(软件与云服务公司),正面对The New York Times(美国报纸)提起的版权诉讼。9月17日,案件中部分原本被遮住的文件公开。报道说,Microsoft应用科学部门负责人布伦特·赫克特曾把AI抓取新闻形容为人类历史上规模最大的劳动窃取。文件还显示,OpenAI内部有人担心,用新闻训练的产品会成为出版社和记者的生存威胁。

背景

AI模型要看大量例子,才会学会回答问题。抓取,是让程序自动收集网页。争议在于,公开可见不等于可以随便复制。美国版权法中的合理使用,有时允许未经许可使用作品,但要看用途、复制的程度,以及它是否伤害原作品的市场。

诉讼材料称,OpenAI和Microsoft收集了大量新闻,并讨论过绕过《纽约时报》付费墙的方法。材料还称,一些数据从搜索服务或网页抓取资料中整理出来,用于训练或测试产品。这些内容主要来自《纽约时报》一方提交的法庭文件,不能直接当作法院已经认定的事实。

为什么重要

问题不只是文章被复制,还关系到人们从哪里获得新闻。如果聊天机器人直接给出答案,读者可能不再打开原新闻网站。报道引用的Microsoft数据称,Copilot回答功能带来的《纽约时报》网站点击率,比传统Bing搜索最多低93%。

这个数字不能证明所有流量下降都由Copilot造成,但说明出版社为什么担心。新闻机构要靠访问量、订阅和广告支付记者、编辑和核查事实的费用。如果收入下降,原创报道可能变少。这样一来,AI自己依赖的新鲜可靠信息也会减少。

文件显示了什么

报道引用的文件称,OpenAI的中期训练数据中,包含三家新闻机构的作品副本超过91,692份。一个来自Common Crawl(公开网页资料库)的数据集,包含来自nytimes.com的文件超过200万份。名为Project Mango的数据项目,至少包含160,903件出版社作品。

Microsoft首席执行官萨蒂亚·纳德拉还作证说,付费墙后的内容如果用于搜索答案或训练,就应该先取得授权。他表示,如果早知道OpenAI使用了这类内容,就会要求重新训练模型。

仍然不清楚的事

TechCrunch提醒,新信息很多来自《纽约时报》的法庭陈述,原始证据仍有一部分没有公开。部分引语也缺少原来的上下文。Microsoft说,赫克特的说法只是个人意见,不是公司的法律分析或正式立场。Microsoft还主张,自己的AI产品改变了材料,并没有取代新闻网站。

法院仍要判断哪些数据被使用、怎样被使用,以及合理使用是否适用。侵权责任和赔偿金额都还没有定论。

接下来要看什么

接下来,关键是法院怎样区分AI学习和输出文章内容。出版社可能要求AI公司签授权协议并支付费用。AI公司也可能改进链接,让读者回到原报道。这个案件最终会追问一个更大的问题:AI获得新闻价值时,能不能一起支持写新闻的人。

参考报道:Ars Technica、TechCrunch。

🤖 AI

AI回答新闻,为什么可能伤害新闻网站?

📰 完整报道: AI学会了新闻,却可能让新闻变弱?法庭文件揭开矛盾

OpenAI和Microsoft因新闻文章面对版权官司。公开文件显示,两家公司内部也担心新闻业受到伤害。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
抓取(zhuāqǔ)

让程序自动收集网页。

合理使用(hélǐ shǐyòng)

满足条件时,可以不先得到许可。

点击率(diǎnjī lǜ)

看到链接的人中,点进去的比例。

💡 一句话总结

  • OpenAI和Microsoft正因新闻文章打官司。
  • 文件显示,两家公司内部也担心新闻业受伤。
  • AI直接给答案,可能让新闻网站少很多访问。

OpenAI(制作ChatGPT的公司)和Microsoft(软件公司)正在应对一场版权官司。《纽约时报》(美国报纸)说,自己的文章被拿去帮助AI学习,而且没有得到许可。

AI要看很多例子,才更会回答问题。程序自动收集网页,叫作抓取。AI公司认为,有些使用可能属于合理使用。意思是,满足条件时,可以不用先得到许可。

但事情会变难。因为聊天机器人可能直接给出新闻内容。读者就可能不再打开原来的新闻网站。网站访问少了,广告和订阅收入也可能变少。新闻机构就更难支付记者、编辑和查证事实的费用。

法庭文件引用的Microsoft数据称,Copilot让《纽约时报》的点击率最多下降93%。比较对象是传统Bing搜索。这不能证明所有下降都由Copilot造成,但能说明出版社为什么担心。

文件还说,训练数据里有大量新闻作品。一个数据集有超过91,692份作品。另一个数据集有超过200万份来自nytimes.com的文件。不过,很多内容来自《纽约时报》一方的说法。Microsoft称,相关发言只是员工个人意见。法院还没有决定AI学习是否违法。

接下来要看,AI公司会不会为新闻签授权协议。也要看它们会不会把读者带回原网站。

🤖 AI

电脑读新闻,会发生什么?

📰 完整报道: AI学会了新闻,却可能让新闻变弱?法庭文件揭开矛盾

AI会读新闻,再回答问题。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
学习材料(xuéxí cáiliào)

帮助电脑学会事情的例子。

法官(fǎguān)

在法庭上判断谁对谁错的人。

官司(guānsi)

请法官判断事情的争论。

OpenAI(做ChatGPT的公司)来了。 Microsoft(做电脑工具的公司)也来了。 《纽约时报》(做新闻的报纸)也来了。 人们先写好新闻。 AI把新闻当作学习材料。 所以AI更会回答问题。 可是,大家可能不去看报纸网站。 网站少了读者。 记者得到的钱也可能变少。 有些公司文件担心这件事。 他们正在请法官判断。 官司还没有结束。 写新闻的人也应该被好好对待。

来源