🔥 HNで話題

「見た目」ではなく法律が問題に OpenAIの本の学習データをめぐる裁判資料

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Authors Guild

米国の作家を代表し、この裁判にも参加している組織。

LibGen

原告側が、許可のない本を含むと説明するオンライン資料庫。

略式判決

完全な審理をせず、法律と証拠で先に判断する手続き。

何が起きたか

2026年9月、米ニューヨーク南部地区の連邦裁判所で、Authors Guild(米国の著者団体)と作家たちが、OpenAI(ChatGPTを作る会社)とMicrosoftを相手にした著作権訴訟が大きく動きました。原告側は9月17日、事実に争いがない部分を裁判官が法律で判断する「部分的な略式判決」を求める申立書を提出しました。9月21日、Authors Guildはその公開資料を紹介し、OpenAIが無断で得た本を使う問題や、作家の仕事への影響を社内で認識していたと主張しました。これは原告側の説明です。

提出資料によると、2018年10月から11月に、OpenAIの社員がLibGenから約11万7500冊をダウンロードし、その中には原告側が挙げた作品96冊が含まれていました。2019年9月から2020年1月には、別の社員が約35テラバイトを取得しました。規模はLibGenの小説とノンフィクションの全コレクション約460万冊に近く、原告側の作品187冊も含まれていたとされます。資料は、これらの本の一部がGPT-3の訓練にコピーされたとも述べています。

背景

争点は「AIが本を読んだか」だけではありません。本をどこから入手したのか、購入や許可があったのか、データセットを作ったのか、モデルを訓練したのか、会社間でコピーを渡したのか、さらに出力が元の市場と競合するのかを分けて問うています。原告側は、OpenAIとMicrosoftが許可や支払いなしに本を使い、作家の作品と競合する商品を作ったと主張します。

一方、OpenAIとMicrosoftは、学習は文章そのものを配るのではなく、統計的なパターンを使って新しい文章を作る変形的な利用であり、米国法のフェアユースに当たると主張しています。Bloomberg Lawによれば、両社は9月4日、裁判官に著作権請求を退けるよう求めました。Bloomberg Lawの報道

なぜ重要か

この事件は、AI企業が大規模な文章を使うとき、データの出どころをどこまで説明し、作者に対価を払うべきかを問います。裁判所が入手方法を重く見るなら、海賊版サイトから得た資料と、許可を得て使った資料は別に扱われる可能性があります。反対に、学習そのものを広くフェアユースと認めれば、AI開発の進め方やライセンス市場に大きな影響が出ます。

元記事はHacker Newsで365 points、304 commentsを集めました。ただし、これはコミュニティの注目度です。裁判資料の主張が正しいと証明する数字ではありません。Hacker Newsの投稿

確認できたこと

確認できるのは、9月17日付の原告側申立書が実在し、そこに本の取得、社内発言、Microsoftが早い時期からLibGenの利用を知っていたという主張、2022年にLibGenのファイルを除こうとした動きが記されていることです。Authors Guildの記事も、これらを自分たちの訴訟資料として紹介しています。原告側の申立書 Authors Guildの記事

まだ分からないこと

裁判所が、資料中の各事実をどう認定するかは未確定です。どの本が最終的なモデルに使われたのか、削除されたファイルがモデルに与えた影響、作家の市場に生じた損害、Microsoftの法的責任も決まっていません。原告側の申立書だけで、OpenAIが違法だったと断定することもできません。

次に見る点

今後は双方の追加書面と、2027年初めに予定される審理が焦点です。裁判官が、学習用コピー、海賊版資料の取得、モデルの出力を同じ問題として扱うのか、それとも分けて判断するのかに注目が集まります。その判断は、作家がAI企業と契約する方法と、企業が訓練データを説明する義務にも影響しそうです。

💬 公開された裁判資料をめぐる、LibGenとAI企業の責任

記事は、Authors GuildとMicrosoft/OpenAIの訴訟で公開された資料を紹介し、OpenAI内部でLibGenの扱いが問題になっていたと伝える。HNでは、法的評価、情報源の偏り、AIの雇用影響をめぐって意見が割れている。

  • 記事が紹介した資料について、OpenAI研究者が懸念していたのは、LibGenの利用が合法かどうかだけでなく、著作権資料をロシア系の疑わしく見えるサイトから使う企業だと世間に受け取られることだった、とコメントされた。これは記事とコメントの読み方であり、裁判所の最終判断ではない。
  • LibGenについては、著作権のある本を大量に含む海賊版資料庫だという見方と、研究に使われる本のアーカイブで、公版資料や絶版本も含むという見方が対立している。
  • Authors Guildは作者側の利益を代表する団体なので、中立ではなく、不利な抜粋を強調しているという批判がある。一方、情報源に利害があっても、公開資料の存在や内容まで無効になるわけではないという反論もある。
  • 法律の議論では、海賊版資料を入手したことと、合法的に得た資料でAIを訓練することを分けるべきだという意見がある。一部コメントはAnthropic訴訟を、後者は変形的利用または訓練自体の違法性とは別に扱われた例として紹介する。他方、当時の現行法は有効で、後から法を変えても過去のルールが自動で消えるわけではないという指摘もある。
  • 個人が少量を非営利で複製することと、企業が大量の資料を集めて有料モデルを作ることは、規模・目的・利益が違うという批判がある。擁護側はモデル訓練を通常の違法コピーとは別の行為と見るが、批判側は企業の意図と結果を重視する。
  • 普通の人やサイト運営者は海賊版で処罰されるのに、大型AI企業はより寛大に扱われているように見える、という不公平感も示された。製品を使わない選択があるという応答だけでは、この公平性の問題は解決しない。
  • 雇用については、AIが過去の自動化産業のように仕事を増やすとは限らないという懸念と、影響が現れるまで時間がかかるため、作者がすでに失業したとまでは言えないという反論がある。

コメント538件時点の成熟版(改訂3)。495件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

OpenAIは本をどう集めた? 作家との裁判をやさしく読む

📰 しっかり版: 「見た目」ではなく法律が問題に OpenAIの本の学習データをめぐる裁判資料

作家たちは、OpenAIが許可なく本を集め、AIの材料にしたと訴えています。OpenAIとMicrosoftは、AIの学習は法律で認められる使い方だと主張しています。まだ裁判の結論は出ていません。

約2分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
著作権

作品を作った人が、その使い方を決める権利。

訓練データ

AIを学ばせるために集めた材料。

LibGen

原告側が、許可のない本を含む場所だと説明するサイト。

💡 ようするに

  • OpenAI(ChatGPTを作る会社)の本の集め方が問題です。
  • 作家側は、著作権を守っていないと訴えています。
  • Hacker Newsで注目されましたが、人気は正しさの証明ではありません。

Authors Guild(作家を支える団体)などは、OpenAIとMicrosoftを訴えています。2026年9月17日、作家側は裁判資料を出しました。資料には、OpenAIの社員がLibGenから多くの本を集めた記録があると書かれています。LibGenは、許可のない本を含むサイトだと説明されています。

資料によると、2018年には約11万7500冊が集められました。2019年から2020年には、約35テラバイトのデータも集められたとされます。これらの本の一部は、GPT-3というAIの訓練データに使われたと、作家側は主張しています。

大切なのは、本を使ったかだけではありません。どこから本を取ったかも問題です。買った本か、許可を取った本かで意味が変わります。AIが文章の特徴を学ぶことを、法律がどう見るかも争われています。

OpenAIとMicrosoftは、AIは本をそのまま配っていないと説明しています。文章の特徴から新しい文章を作るので、法律上のフェアユースだと主張しています。これは、一定の条件で他人の作品を使える仕組みです。

裁判所はまだ結論を出していません。原告側の資料だけで、違法だったと決めることはできません。

元記事のHacker News投稿は365 points、304 commentsでした。これは読者の注目度です。主張の正しさを示す数字ではありません。原告側の資料 Hacker News

💬 LibGenとAIの法律問題をめぐる議論

公開された裁判資料をきっかけに、OpenAIが何を心配していたのか、AIの訓練は著作権法に違反するのかが議論された。コメントは一つの結論にまとまっていない。

  • 資料は、OpenAIの人たちがLibGenの利用が合法かだけでなく、ロシア系のサイトを使ったように見えることによる悪い評判も心配していた、と読まれている。
  • LibGenは、著作権本を集めた海賊版資料庫だという人と、研究用の本のアーカイブで、公版本や古い本もあるという人に分かれている。Authors Guildも作者側の団体なので偏っているという批判があるが、偏りがあっても資料が無価値になるとは限らない。
  • 法律では、盗用された資料を手に入れることと、合法的に得た資料でAIを訓練することを分けるべきだという意見がある。Anthropicの裁判を例にする人もいるが、現在の法律や、会社が大規模に利益目的で集めたことを重視する人もいる。
  • 大企業だけが海賊版で許されているように見えるのは公平か、AIで仕事が減るのかも争点になった。仕事への影響はすぐに出るとは限らない、という反論もある。

コメント538件時点の成熟版(改訂3)。495件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

OpenAIと作家さんが、本の使い方を話し合う裁判

📰 しっかり版: 「見た目」ではなく法律が問題に OpenAIの本の学習データをめぐる裁判資料

OpenAI(ChatGPTを作る会社)は、本をAIの材料にしました。作家さんは、その使い方がよかったかをたずねています。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Authors Guild

作家さんを助ける団体。

LibGen

許可のない本があると言われる場所。

Hacker News

技術の話をする人が集まるサイト。

OpenAIは、本を使ってAIを作りました。

Authors Guild(作家さんを助ける団体)は、裁判を起こしました。

Microsoft(コンピューターの会社)も、この裁判に入っています。

作家さんは、本を使う前に許可が必要だと言います。

LibGenは、許可なく本を置く場所だとされています。

作家側の資料には、たくさんの本を集めた記録があります。

その本の一部は、GPT-3の材料になったとされます。

OpenAIとMicrosoftは、別の考えを持っています。

AIは本をそのまま配っていないと説明しています。

本から特徴を学んで、新しい文章を作ると説明しています。

裁判官は、まだ答えを出していません。

だから、今はどちらが正しいか決まっていません。

元記事はHacker Newsでも話題になりました。

投稿は365 pointsと304 commentsを集めました。

これは、たくさんの人が見たという意味です。

正しいと決まったという意味ではありません。

元記事 Hacker News

💬 AIは本を使ってもいいの?

裁判の書類をきっかけに、AI会社が本を集めたことと、その見え方について話し合いが起きました。

  • OpenAIの人たちは、法律だけでなく、世間からどう見えるかも気にしていた、と読む人がいます。
  • そのサイトを、許可なく集めた本の倉庫と見る人も、勉強に使える図書館と見る人もいます。著者の団体が自分に都合のよい部分を強調したのか、という話もあります。
  • みんなは、AIに本を学ばせることと本を無断で集めることは同じか、大きな会社と普通の人を同じルールで扱うか、AIで仕事が減るかを話しています。コメントだけでは答えは決まっていません。

コメント538件時点の成熟版(改訂3)。495件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考