🤖 AI

AIがAIの安全対策を改良、Anthropic(Claudeを作るAI会社)の研究者はなぜ辞めたのか

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
自己改善(じこかいぜん)

AIが自分や別のAIの学び方を改良し、性能を高める流れ。

アラインメント(あんらいめんと)

AIが人の意図に沿うよう整える研究。

評価課題(ひょうかかだい)

AIの安全や性能を調べるための問題。

何が起きたか

2026年9月9日、Jacob Coxon氏がAnthropic(Claudeを作るAI会社)を辞めたと公表しました。Coxon氏は、OpenAI(ChatGPTを作るAI会社)とAnthropicで、約3年間、事前学習の研究をしていた人物です。AI企業が「自分で自分を改良する超知能」の開発へ急ぎ、人類の命を賭けていると批判しました。これは、今あるAIが人類を滅ぼしたという発表ではなく、将来への警告です。

同社のアラインメント科学を率いるEvan Hubinger氏も、この懸念に公に同意しました。Hubinger氏は、自分の見積もりでは、AIが今後10年以内に人類全体を滅ぼす可能性は10%を超えると述べました。この数字は、測定済みの確率ではありません。

背景にある「AIがAIを研究する」流れ

ここでいう自己改善は、AIが論文を調べ、改善方法を考え、別のAIを訓練し、結果を試す流れです。これを繰り返すと、AI研究が人間だけの作業より速くなる可能性があります。Coxon氏が恐れるのは、人間が変化を理解し、止める時間を失うことです。

この警告と同じ時期に、Anthropicは8月28日、自動化した安全研究の報告を公開しました。Claudeを使い、AIの不適切な振る舞いを調べる10種類の評価課題で改善策を探させた研究です。

研究で確認できたこと

システムは文献を調べ、方法を提案し、対象モデルを訓練して、結果をテストしました。Anthropicの説明では、10種類すべてで評価結果が改善し、測定した一般能力は落ちませんでした。見せていない評価課題でも効果があり、最適化したモデルの最大4.7倍の大きさのモデルにも方法が効きました。

28人の人間の安全研究者との比較では、自動システムが上回りました。ただし、人間側は同じように試行を重ねられませんでした。これは新しい研究方法の有望さを示す実験であり、人間が不要になった証明ではありません。

なぜ重要か

AIが安全研究を速めれば、危険を早く見つける助けになります。一方、AIが研究全体を速めるなら、能力向上も加速するかもしれません。安全策を作る側が、その速度に追いつけるかが問題です。

まだ分からないこと

評価課題は現実の安全をすべて表しません。測っていない能力を損なう可能性もあり、別の訓練後も効果が続くかは未確認です。将来の強いモデルで、監視が同じように働く保証もありません。

また、10%超という数字を科学的に確かめる方法は示されていません。辞職と発言は重い警告ですが、人類滅亡が近いことの証明ではありません。公開情報だけでは、Anthropicなどの安全計画の全体像も分かりません。

次に見る点

今後は、独立した評価、見せていない課題での再検証、監視をすり抜けようとした場合の対応計画が焦点です。Coxon氏は、研究所どうしの速度調整や、能力向上を一時的に止める仕組みも提案しました。これは共通ルールではありません。

今回の問いは、AIがAIを改良できるかだけではありません。人間の安全確認も、同じ速さで進められるかです。

辞職と発言はArs TechnicaとTechCrunchが報じ、研究の内容と限界はAnthropic公式説明とTechCrunchの研究報道で確認できます。

🤖 AI

AIがAIの安全を調べる研究、Anthropic(Claudeを作るAI会社)で警告

📰 しっかり版: AIがAIの安全対策を改良、Anthropic(Claudeを作るAI会社)の研究者はなぜ辞めたのか

Anthropic(Claudeを作るAI会社)で研究していたJacob Coxon氏が、会社を辞めました。AIが自分で自分を強くする未来を心配したためです。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Anthropic(アンソロピック)

Claudeを作るAI会社。

自己改善型AI(じこかいぜんがたエーアイ)

自分で自分を強くするAI。

安全テスト(あんぜんテスト)

AIが危ない動きをしないか調べる試験。

💡 ようするに

  • AIがAIの安全を調べる実験が進みました。
  • Anthropicの研究者が、開発の速さを心配して辞職しました。
  • 研究の成功と、未来への心配が同時に出ました。

Anthropicで研究していたJacob Coxon氏が、会社を辞めました。自己改善型AIを心配したためです。これは、自分で自分を強くするAIです。

同じ会社のEvan Hubinger氏も心配を表しました。10年以内にAIが人類全体を滅ぼす可能性は、10%を超えると考えています。ただし、これは本人の予想です。実験で測った数字ではありません。

一方、AnthropicはAIの安全を調べる研究を発表しました。Claudeを使う自動システムが、論文を調べ、方法を考え、別のAIを訓練しました。10種類の安全テストで、すべての結果がよくなりました。ふつうの力も落ちませんでした。

この実験は、AIが安全研究を助けられることを示します。しかし、安全テストは現実の一部しか見ません。見ていない危険が残るかもしれません。別の学習をした後も、安全が続くかは未確認です。

だから、研究の成功だけで安心はできません。AIが研究を速めるほど、人が変化を調べる時間も短くなるかもしれません。大切なのは、作る速さと安全を確かめる速さをそろえることです。

今後は、別の研究者による再検証や、監視をすり抜けた時の対応計画が注目されます。Coxon氏は、会社どうしで開発速度を調整する案も出しました。まだ決まったルールではありません。

🤖 AI

AIがAIを手伝う話、Anthropic(Claudeを作るAI会社)の心配

📰 しっかり版: AIがAIの安全対策を改良、Anthropic(Claudeを作るAI会社)の研究者はなぜ辞めたのか

Anthropicで、AIを調べる人が会社をやめました。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Anthropic(アンソロピック)

Claudeを作るAI会社。

安全テスト(あんぜんテスト)

AIが安全か調べる試験。

AIは、例から答え方を学ぶ機械です。

Anthropicでは、AIに安全の勉強を手伝わせました。 「直す」は、安全に動く学び方に変えることです。 AIは、十個の安全テストをしました。 結果は、よくなりました。 ふつうの力も落ちませんでした。

でも、テストは世界全部ではありません。 まだ見つからない危険があるかもしれません。

Jacob Coxonさんは、会社をやめました。 AIが自分でどんどん強くなるのを心配したからです。 Evan Hubingerさんも、未来を心配しました。 十年のうちに、とても危ないかもしれないと考えました。 これは未来の予想です。

今のAIが人を滅ぼした話ではありません。 人は、AIを作る速さと見張る方法を考えています。

出典・参考