1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり
パラメーター(ぱらめーたー)
AIの答え方を調整するための大量の数字です。
量子化(りょうしか)
AIの数字を少ない容量で保存する方法です。
トークン(とーくん)
AIが文章を処理するときの小さな単位です。
何が起きたか
Strata(大きなAIをパソコンで動かすソフト)は、Qwen3.8-Flash-Next(Qwenチームが作ったAIモデル)を、WindowsやLinuxのゲーム用PCで動かします。モデルの規模は1250億パラメーター。ふつうは大きなサーバーで扱う大きさです。Strataは無料のオープンソースとして公開されています。詳しい条件はプロジェクトのREADMEにまとめられています。
なぜ動かせるのか
大きなモデルを、そのままグラフィックスカードのメモリーへ入れるのが難しさの出発点です。Strataは、仕事をパソコン全体に分けます。モデルには2万4576個の専門家のような部分があり、次の言葉を選ぶときは、そのうち約10個だけを使う設計です。よく使う部分をGPU、全体をRAM、残りの計算をCPUが受け持ち、SSDも参照表の置き場所になります。
さらに、モデルは数字を少ない容量で保存する量子化版にできます。小さい版は速く、大きい版は能力を保ちやすい一方、圧縮の仕方で答えの質が変わる可能性があります。小さな補助役が次の言葉を先に予想し、大きなモデルがまとめて確認する仕組みについて、READMEは1.6〜1.8倍速くなると説明しています。
速度の数字をどう読むか
タイトルの100T/sにあるTは、1秒に100兆という意味ではなく、token(トークン)毎秒の略です。トークンはAIが文章を処理する小さな単位で、READMEは英語なら約4分の3語に相当すると説明します。Hacker News(技術ニュースの掲示板)では、投稿者がRTX 4090、128GBのメモリー、Ryzen 7950X3Dを使い、毎秒124トークンだったと報告しました。
ただし、これは投稿者の環境での記録です。READMEの測定では、RTX 5070でモデルの版により毎秒53〜94トークン、RX 9070 XTで44〜60トークンでした。RTX 3090なら毎秒100〜140トークンほどになる、という見積もりも載っています。Hacker Newsの投稿には600点を超える評価と300件近いコメントが集まりましたが、これはコミュニティーの注目度です。速さや品質を証明する数字ではありません。投稿と反応は、測定結果とは分けて読む必要があります。
なぜ重要か
これまで大きなAIを使うには、会社のサーバーへ質問を送るのが普通でした。Strataの説明どおりにローカルで動けば、通常の使い方では会話を自分のPCの中に置けます。一方で、費用の中心がクラウド料金から、GPU、RAM、保存容量、電気、準備時間へ移ります。必要条件はGPUのメモリー12GB以上、RAM32GB以上、空き容量約80GBです。モデルのダウンロードだけで約70GBあり、初回起動ではRAMの35〜55GBを使い、1〜3分ほどPCが重くなることがあります。
確認できたことと、まだ分からないこと
確認できるのは、実際に入手できるソフトがあり、対応する機械と測定表が公開されていることです。確認できないのは、124トークン毎秒が多くのRTX 4090で再現するか、クラウドのAIと同じ品質になるか、画像や長い仕事でも同じ速度になるかです。READMEの数字は重要な手がかりですが、独立した同じ条件の比較ではありません。
次に見る点
今後は、同じ量子化版を複数のPCで測る試験、速度と回答品質を同時に比べる試験、画像入力やAIエージェントでの安定性が必要です。Strataが示したのは「1250億パラメーターなら必ず家で動く」という結論ではありません。大きなAIを、GPUだけでなくPC全体で動かす道が現実になりつつある、ということです。
大きなAIがゲーム用PCで動く? Strataの工夫
📰 しっかり版: 1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり
1250億の調整値を持つAIを、自分のPCで動かす試みです。
パラメーター(ぱらめーたー)
AIが答えを選ぶときに使う調整値です。
量子化(りょうしか)
数字を小さく保存する方法です。
トークン(とーくん)
AIが文章を数える小さな単位です。
💡 ようするに
- Strataは大きなAIをPCで動かすソフトです。
- 一人の投稿者は毎秒124トークンと報告しました。
- Hacker Newsの人気は速さの証明ではありません。
Strataは、Qwen3.8-Flash-NextというQwenチームのAIモデルを動かします。モデルには1250億個のパラメーターがあります。パラメーターは、AIが答えを選ぶときに使う調整値です。
こんなに大きなモデルは、普通なら大きなサーバーが必要です。Strataは、仕事を一つの部品に集めません。モデルには2万4576個の専門家のような部分があります。次の言葉を考えるとき、毎回すべては使いません。必要な約10個を選びます。GPU、RAM、CPU、SSDが仕事を分けるので、少ないGPUメモリーでも動かせます。
モデルには量子化版もあります。量子化は、数字を小さく保存する方法です。小さい版は速く動きます。大きい版は能力を保ちやすいとされます。ただし、圧縮の仕方で答えが変わることがあります。
タイトルの100T/sは、1秒に100トークンという意味です。1トークンは、AIが文章を処理する小さな単位です。Hacker Newsという技術ニュース掲示板で、投稿者はRTX 4090のPCで毎秒124トークンと報告しました。投稿には600点を超える評価と、300件近いコメントが集まりました。これは多くの人が話題にしたという意味です。AIの速さを証明する数字ではありません。
READMEの測定では、RTX 5070で毎秒53〜94トークンでした。必要な機械は、GPUメモリー12GB以上、RAM32GB以上、空き容量約80GBです。モデルのダウンロードは約70GBです。初回はPCが1〜3分ほど重くなることもあります。
大事なのは、会社のサーバーを使わず、PCでAIを動かせる点です。ただし、どのPCでも同じ速さになるわけではありません。回答の質も、モデルの版や仕事の種類で変わります。これからは、同じ条件での独立した比較が必要です。
💬 Qwen 3.8 Flash Nextは速いが、設定で結果が変わる
HNでは、Strataを使えば大きなQwenモデルを家庭用機材で動かせるという報告が出ている。ただし、速さと正確さは同じ条件で比べられていない。
- 利用者の自己申告では、RTX 4090で約124 tokens/s、GPUなしで約7 tokens/sという例がある。機材や圧縮方法が違うので、数字をそのまま比較はできない。
- 一部の利用者は、125BのFlash NextやCoder版が27B版よりコーディングに強いと感じている。READMEを引用したコメントでは、Coder版は作者測定でフルモデルのSWE-bench Verifiedの91%、RAM 32GBとされる。
- 一方で、27B版の方が正確だという報告や、4-bitの27Bが3-bitのFlashを上回ったという報告もある。低ビット量子化は速くて小さくなるが、2-bitなどでは品質が落ちることがある。
- 長い文章を扱うときの結果も一致しない。262K文脈まで良いという人がいる一方、150K前後でスペルミスや指示無視を経験し、設定が原因かもしれないと考えた人もいる。
- 比較には共通ベンチマークが必要で、導入時はリモートのインストールスクリプトやsudoを無条件に信用せず、コードと配布物を確認するべきだという議論もある。
コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
大きなAIが、おうちのパソコンに入った?
📰 しっかり版: 1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり
ゲーム用のパソコンで、大きなAIを動かすお話です。
Strata(ストラタ)
大きなAIをパソコンで動かすソフトです。
トークン(とーくん)
AIが読む文の小さな区切りです。
Hacker News(ハッカー・ニュース)
技術のニュースをみんなで話す場所です。
Strata(ストラタ)は、大きなAIを家のパソコンで動かすソフトです。 Qwen3.8-Flash-Next(クウェン)は、文を作るAIです。 このAIには、1250億個の調整値があります。
大きなAIは、たくさんの場所を使います。 Strataは、パソコンの場所を分けて使います。 絵を出す部品も使います。 覚える場所も使います。 保存する場所も使います。
AIには、専門の小さな係がたくさんいます。 毎回、全部の係は呼びません。 必要な係だけを呼びます。 だから家のパソコンでも動かせます。
投稿した人は、毎秒124トークンと書きました。 トークンは、AIが読む文の小さな区切りです。 Hacker News(技術ニュースの掲示板)でも話題になりました。 人気の点は600をこえました。 書き込みは300件近くありました。 これは、みんなが話した数です。 AIの速さを証明する数ではありません。
動かすには、約70GBのデータがいります。 最初はパソコンが1〜3分重くなることがあります。 別のパソコンでは、速さが変わるかもしれません。
💬 大きなAIを家のパソコンで動かせる?
Strataを使うと、とても大きなAIを家の機械で動かせることがある。でも、速さと賢さは機械の設定で変わる。
- ある人はRTX 4090で約124 tokens/s、別の人はGPUなしで約7 tokens/sだった。これは利用者の自己申告で、同じテストではない。
- このAIが小さな27B版より良いと言う人もいれば、圧縮を少なくした27B版の方が正確だと言う人もいる。どちらがいつも勝つわけではない。
- AIを小さく圧縮すると速く動くが、圧縮しすぎると間違いが増えることがある。長い会話やインストール用スクリプトは、人が確認する必要がある。
コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 StrataでQwen 3.8 Flash Nextを動かす:家の機材でも高速、品質は条件依存
HNの利用者報告では、Strataにより125BのMoEモデルを消費者向けGPUや大量のCPUメモリで実用的な速度にできる。ただし、量子化・推論エンジン・文脈長・タスクが揃っておらず、速度や賢さについて一般的な結論はまだ出ていない。
コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。