🔥 HNで話題

Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Qwen3.8 A95B

この実験で調べられたAIモデルの名前。

推論プレフィル

別のAIが考えた文のはじめを、答えるAIの出発点に置く試し方。

ソースリコール

二つの答えの似た部分が、どれくらい早い位置に出たかを見る点数。

何が起きたか

投稿者のwsxiaoysは、GitHub Gistに「Reasoning prefills on a few open models, v1.1」という実験記録を公開した。前の実験の続きで、今回はGPT-5.5 Pro(手本にするAIモデル)を教師役にした。

調査は45問で、STEM、非STEM、合成パズルが各15問。Qwen3.8 A95B(調べられたAIモデル)など4モデルについて、各問題を2回ずつ試した。1回は普通に答え、もう1回はGPT-5.5 Proの推論の最初の1%を、調べるモデルの推論チャンネルに置いた。画面に出る答え自体は、各モデルが自由に作った。

研究者は、GPT-5.5 Proの見える答えが、各モデルの答えの最初の100トークンにどれだけ現れたかを測った。スコアは、1語・2語・3語のまとまりの重なりを平均したソースリコールである。Qwen3.8 A95Bは、何も置かない時の16.79%から、置いた時の34.97%へ上がった。差は18.18ポイントだった。STEMでは19.26%から46.24%となり、差は26.99ポイントだった。

背景

この操作を推論プレフィルと呼ぶ。AIが答え始める前に、別のAIの推論の短い先頭を置き、その後の答えの重なりを見る方法だ。今回はQwenの新機能を報じたのではなく、投稿者が外から行った比較実験である。測ったのは全思考ではなく、見える答えの最初の100トークンだけだ。

なぜ重要か

Qwenの変化は、4モデルの中で目立って大きかった。DeepSeek V4 Flashは27.30%から26.13%へ下がり、Inklingは19.99%から20.45%、Kimi K3は31.11%から35.65%へ上がった。Qwenだけが、全体で18.18ポイント動いた。

投稿者は、QwenがGPT-5.5 Pro、または近いGPTモデルから学んだ可能性を示す。前のOpus 4.8を使った実験では、Qwenはほとんど動かなかったという。これは、出力の反応から訓練の手がかりを探せるか、という問いを投げかける。

確認できたこと

確認できるのは、実験の条件と数字である。Qwenでは、GPT-5.5 Proの推論の最初の1%を置いた時、最初の100トークンで測った重なりが増えた。STEM、非STEM、パズルの全カテゴリで増え、増加幅は順に26.99、12.80、14.75ポイントだった。

この投稿はHacker Newsで235 points、93 commentsとなった。これは技術コミュニティの注目度を示す数字で、実験の正しさを証明する数字ではない。話題になったことと、結果が正しいことは分けて考える必要がある。

まだ分からないこと

この結果だけでは、Qwen3.8 A95BがGPT-5.5 Proの出力を訓練に使ったとは言えない。近いGPTモデルだったのか、別の条件が効いたのか、今回の問題に特有の反応なのかは分からない。

実験は45問で、相手モデルはGPT-5.5 Proの1種類、測定は答えの最初の100トークンだった。重なりが増えたことは、答えが同じになったことでも、性能が上がったことでもない。

次に見る点

次は、別の人が同じ手順を再現できるかが重要だ。問題数を増やし、別の分野やモデルの版でも試せば、今回の数字が広く続くかを見られる。推論の先頭の長さを変え、GPT以外を手本にした時も比べたい。

現時点で確かなのは、短いGPT推論の先頭を置く実験で、Qwenの出力の重なりが大きく増えたことだ。QwenがGPTを学習したという断定は、再検証を待つ必要がある。

💬 Qwen 3.8はGPT-5.5 Proを学んだのか

HNコメントの中心は、Qwen 3.8がGPT-5.5 Proの推論データから学習した可能性を示す実験と、それだけでは盗用や能力移転を証明できないという反論である。以下の数値・性能・不具合は記事や利用者の報告であり、ここでは独立検証していない。

  • 参照された論文の手法では、暗号化された推論トークンを同系統のモデルに戻して可読な文章に書き起こさせ、その推論の冒頭約1%をオープンモデルの推論開始部として与え、回答の変化を比較する。
  • 記事の報告では、GPT-5.5 Proの推論プレフィルを与えたQwen 3.8がGPT側へ20.58ポイント近づき、非公開の合成パズルでも大きな効果が出た。以前の比較では、Claude 4.8の推論を与えたKimi-K3でも似た接近が報告された。
  • 支持側は、プレフィルなしのQwenはGPTとかなり違うのに、GPTの推論冒頭を合わせると急に似る点を重視する。DeepSeek V4 FlashやKimi-K3との比較も、GPTの推論過程と回答が学習データの一部だった可能性を示す、と解釈されている。
  • 強い反論は、利用可能なGPT-5.5の推論例が8月10日に公開された論文由来のものに限られ、Qwen 3.8 0902はその後に学習されたというものだ。その場合、Qwenは公開された特定例を記憶しただけで、秘密の推論トレースを抽出したとは限らない。
  • 結果だけでは、学習に使った量、能力そのものの移転か文体模倣か、両モデルが同じベンチマーク解答を見ただけではないかは分からない。少量の追加学習でも相関は上がり得るため、新しい推論例や未公開課題を使った対照実験が必要だという意見がある。
  • 利用者の自己申告では、別モデルの推論がツール呼び出しに漏れて停止した経験や、Qwen 3.8 27Bに似た推論を見た例がある。一方で、普通の文章的な推論しか見ない人もおり、プロンプト、システム指示、UI、量子化、推論強度で挙動が変わる可能性がある。
  • 競合出力の蒸留を後追いや不公平と見る人がいる一方、GPTを動かせなくても重みを持つQwenをローカルで実行できる点で、蒸留は大きな工学的成果だという意見もある。コメント欄は、公開データ学習との倫理的な違いも含めて割れている。

コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

AIに「考えはじめ」を見せると、答えは似る?

📰 しっかり版: Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味

Qwen3.8 A95BにGPT-5.5 Proの考えはじめを少し見せる実験で、答えの似方が大きく変わりました。ただし、まねしたと証明されたわけではありません。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Qwen3.8 A95B

この実験で調べられたAIの名前です。

推論プレフィル

別のAIの考えはじめを少し先に置く試し方です。

Hacker News

技術の話をする人が集まるサイトです。

💡 ようするに

  • Qwen3.8 A95B(答えを作るAI)を調べた。
  • GPT-5.5 Pro(手本にするAI)の考えはじめを少し渡した。
  • 答えは似たが、学習した証拠とはまだ言えない。

一人の投稿者が、GitHub Gistに実験を書きました。45問を使い、4つのAIを比べました。問題はSTEM、非STEM、合成パズルに分かれていました。

各AIには、同じ問題へ2回答えてもらいました。1回は何も渡さない方法です。もう1回は、GPT-5.5 Proの推論の最初の1%を先に置きました。この試し方を推論プレフィルと呼びます。最後の答えは、Qwenなど各AIが自分で作りました。

研究者は、答えの最初の100トークンを比べました。トークンは、AIが文章を区切る小さな単位です。Qwen3.8 A95Bでは、似た部分が16.79%から34.97%に増えました。差は18.18ポイントです。STEM問題では、19.26%から46.24%に増えました。

他のAIの変化は、Qwenより小さめでした。投稿者は、QwenがGPT-5.5 Pro、または近いGPTモデルから学んだ可能性を示しました。ですが、これは推測です。この実験だけで、学習元を特定することはできません。

この話はHacker Newsでも注目され、235 pointsと93 commentsが付きました。これは話題の大きさです。実験が正しい証明ではありません。今後は、もっと多くの問題や別のAIで、同じ結果が出るか確かめる必要があります。

💬 実験が示すことと、まだ証明していないこと

コメントは、Qwen 3.8がGPT-5.5 Proの考え方に似る可能性を議論している。ただし、数値・性能・不具合は記事や利用者の自己申告で、独立に確かめた結果ではない。

  • 最先端モデルの隠れた推論を読める形にし、その最初の約1%をQwenに見せて、答えが変わるかを調べる実験が行われた。
  • 記事では、Qwen 3.8の点数がGPT-5.5 Pro側へ20.58ポイント近づいたと報告され、非公開の合成パズルでも効果があった。前のClaude 4.8とKimi-K3の比較でも似た結果が報告された。
  • 支持者は、GPTの推論の始まりを見せた時だけQwenの答えが急に似るので、GPTの推論データで学んだ可能性があると考える。
  • 反対者は、使われたGPTの例が8月10日に公開され、Qwen 3.8 0902はその後に学習されたなら、公開例を覚えただけかもしれないと指摘する。
  • この実験だけでは、学習量、能力と文体のどちらが移ったのか、同じ問題の解答を両方が学んだだけなのかは分からない。利用者の推論表示も環境で変わるという報告がある。
  • 蒸留を不公平な後追いと見る人もいれば、誰でもローカルで動かせるモデルを作る重要な成果と見る人もいる。

コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Qwen3.8は、AIの「考えはじめ」で答えが変わった?

📰 しっかり版: Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味

別のAIの考えはじめを少し見せて、答えが似るか調べました。似ましたが、学んだほんとうのしるしではありません。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Qwen3.8 A95B

答えを考えて書くAIの名前です。

GPT-5.5 Pro

別の答えを考えて書くAIの名前です。

Hacker News

技術の話を読む人が集まるサイトです。

Qwen3.8 A95Bは、答えを作るAIです。 GPT-5.5 Proは、別の答えを作るAIです。 調べた人は、GPTの考えはじめを見せました。 Qwen3.8 A95Bは、45問に答えました。 見せない時と、見せた時を比べました。 見せると、答えが少し似ました。

でも、これは学んだしるしではありません。 まだ、小さな試しだからです。 答えの似方だけを見ました。 考えの全部を見たわけではありません。

Hacker News(技術の話をするサイト)でも、注目されました。 注目されたから、正しいとは限りません。 もっと試して、たしかめる必要があります。

💬 Qwenの考え方はGPTに似たの?

大きなAIの考え始めを別のAIに見せて、答えが似るかを試した話だ。数値や不具合は記事と利用者の報告で、まだ一つの答えに決まったわけではない。

  • 記事の実験では、隠れた考えを読める形にして、その最初の部分をQwen 3.8に見せた。
  • 記事では、Qwenの点数がGPT-5.5 Pro側へ20.58ポイント近づいたと報告された。前の実験でも、別のAIどうしが似た動きをしたと報告されている。
  • でも、GPTの例は先に公開されていたかもしれない。Qwenはその例を覚えただけかもしれず、これだけでは秘密の考えを盗んだ証拠にならない。
  • どれだけ学んだのか、賢さか話し方かはまだ不明だ。人によって見える考え方も違い、コピーだと心配する人と、家で動かせるAIは役に立つと考える人がいる。

コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考