🔥 HNで話題

1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
パラメーター(ぱらめーたー)

AIの答え方を調整するための大量の数字です。

量子化(りょうしか)

AIの数字を少ない容量で保存する方法です。

トークン(とーくん)

AIが文章を処理するときの小さな単位です。

何が起きたか

Strata(大きなAIをパソコンで動かすソフト)は、Qwen3.8-Flash-Next(Qwenチームが作ったAIモデル)を、WindowsやLinuxのゲーム用PCで動かします。モデルの規模は1250億パラメーター。ふつうは大きなサーバーで扱う大きさです。Strataは無料のオープンソースとして公開されています。詳しい条件はプロジェクトのREADMEにまとめられています。

なぜ動かせるのか

大きなモデルを、そのままグラフィックスカードのメモリーへ入れるのが難しさの出発点です。Strataは、仕事をパソコン全体に分けます。モデルには2万4576個の専門家のような部分があり、次の言葉を選ぶときは、そのうち約10個だけを使う設計です。よく使う部分をGPU、全体をRAM、残りの計算をCPUが受け持ち、SSDも参照表の置き場所になります。

さらに、モデルは数字を少ない容量で保存する量子化版にできます。小さい版は速く、大きい版は能力を保ちやすい一方、圧縮の仕方で答えの質が変わる可能性があります。小さな補助役が次の言葉を先に予想し、大きなモデルがまとめて確認する仕組みについて、READMEは1.6〜1.8倍速くなると説明しています。

速度の数字をどう読むか

タイトルの100T/sにあるTは、1秒に100兆という意味ではなく、token(トークン)毎秒の略です。トークンはAIが文章を処理する小さな単位で、READMEは英語なら約4分の3語に相当すると説明します。Hacker News(技術ニュースの掲示板)では、投稿者がRTX 4090、128GBのメモリー、Ryzen 7950X3Dを使い、毎秒124トークンだったと報告しました。

ただし、これは投稿者の環境での記録です。READMEの測定では、RTX 5070でモデルの版により毎秒53〜94トークン、RX 9070 XTで44〜60トークンでした。RTX 3090なら毎秒100〜140トークンほどになる、という見積もりも載っています。Hacker Newsの投稿には600点を超える評価と300件近いコメントが集まりましたが、これはコミュニティーの注目度です。速さや品質を証明する数字ではありません。投稿と反応は、測定結果とは分けて読む必要があります。

なぜ重要か

これまで大きなAIを使うには、会社のサーバーへ質問を送るのが普通でした。Strataの説明どおりにローカルで動けば、通常の使い方では会話を自分のPCの中に置けます。一方で、費用の中心がクラウド料金から、GPU、RAM、保存容量、電気、準備時間へ移ります。必要条件はGPUのメモリー12GB以上、RAM32GB以上、空き容量約80GBです。モデルのダウンロードだけで約70GBあり、初回起動ではRAMの35〜55GBを使い、1〜3分ほどPCが重くなることがあります。

確認できたことと、まだ分からないこと

確認できるのは、実際に入手できるソフトがあり、対応する機械と測定表が公開されていることです。確認できないのは、124トークン毎秒が多くのRTX 4090で再現するか、クラウドのAIと同じ品質になるか、画像や長い仕事でも同じ速度になるかです。READMEの数字は重要な手がかりですが、独立した同じ条件の比較ではありません。

次に見る点

今後は、同じ量子化版を複数のPCで測る試験、速度と回答品質を同時に比べる試験、画像入力やAIエージェントでの安定性が必要です。Strataが示したのは「1250億パラメーターなら必ず家で動く」という結論ではありません。大きなAIを、GPUだけでなくPC全体で動かす道が現実になりつつある、ということです。

💬 StrataでQwen 3.8 Flash Nextを動かす:家の機材でも高速、品質は条件依存

HNの利用者報告では、Strataにより125BのMoEモデルを消費者向けGPUや大量のCPUメモリで実用的な速度にできる。ただし、量子化・推論エンジン・文脈長・タスクが揃っておらず、速度や賢さについて一般的な結論はまだ出ていない。

  • 速度の自己申告では、RTX 4090・128GB DDR5・Ryzen 7950X3Dで約124 tokens/s、専用GPUなしの96GB RAM機で約7 tokens/s(プロンプト処理は約60 tokens/s)。いずれも利用者の実測で、量子化や設定は同じではない。
  • Flash Nextは125B規模のMoEで、Coder版は専門家の一部を削った派生版と説明されている。READMEを引用したコメントでは、作者測定でフルモデルのSWE-bench Verifiedの91%に達し、32GBのRAMに収まるとされる。
  • 品質の評価は割れている。複数の利用者は27B版よりコーディングや実用タスクに強いと感じている一方、別の利用者はFP8の27B版の方が正確だと報告し、別のテストでは4-bitの27Bが3-bitのFlashを上回ったとされる。
  • 量子化が結果を大きく左右する。IQ3やImportance Matrix、Ridge、RCO-GSQなどで品質を保てたという報告がある一方、引用された研究では4-bitは比較的保ちやすく、2-bitでは広い性能低下が起きやすいとされる。専門家を削った低ビット版で深刻な劣化を見たという報告もある。
  • 長文脈の信頼性にも差がある。利用者の一人はネイティブの約262K文脈まで良好だとし、別の利用者は約500K設定(クライアント側は256Kに制限)で、約150K付近からスペルミスやMarkdown指示の無視を経験した。後者はモデルより設定の問題だろうと見ている。
  • 速度だけでは比較できない。コメントでは、量子化形式、推論エンジン、RAMとPCIeの帯域、文脈長、推論強度を揃えた共通ベンチマークを求める声が多く、実際のタスクでの正確さや再試行回数も見るべきだと指摘されている。
  • 導入方法には安全面の議論もある。リモートのシェルスクリプトやsudo、再現可能な配布物の不足を警戒する意見があり、別の意見ではコード監査、固定バージョン、パッケージマネージャーの利用でリスクを下げられるとされる。

コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

大きなAIがゲーム用PCで動く? Strataの工夫

📰 しっかり版: 1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり

1250億の調整値を持つAIを、自分のPCで動かす試みです。

約2分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
パラメーター(ぱらめーたー)

AIが答えを選ぶときに使う調整値です。

量子化(りょうしか)

数字を小さく保存する方法です。

トークン(とーくん)

AIが文章を数える小さな単位です。

💡 ようするに

  • Strataは大きなAIをPCで動かすソフトです。
  • 一人の投稿者は毎秒124トークンと報告しました。
  • Hacker Newsの人気は速さの証明ではありません。

Strataは、Qwen3.8-Flash-NextというQwenチームのAIモデルを動かします。モデルには1250億個のパラメーターがあります。パラメーターは、AIが答えを選ぶときに使う調整値です。

こんなに大きなモデルは、普通なら大きなサーバーが必要です。Strataは、仕事を一つの部品に集めません。モデルには2万4576個の専門家のような部分があります。次の言葉を考えるとき、毎回すべては使いません。必要な約10個を選びます。GPU、RAM、CPU、SSDが仕事を分けるので、少ないGPUメモリーでも動かせます。

モデルには量子化版もあります。量子化は、数字を小さく保存する方法です。小さい版は速く動きます。大きい版は能力を保ちやすいとされます。ただし、圧縮の仕方で答えが変わることがあります。

タイトルの100T/sは、1秒に100トークンという意味です。1トークンは、AIが文章を処理する小さな単位です。Hacker Newsという技術ニュース掲示板で、投稿者はRTX 4090のPCで毎秒124トークンと報告しました。投稿には600点を超える評価と、300件近いコメントが集まりました。これは多くの人が話題にしたという意味です。AIの速さを証明する数字ではありません。

READMEの測定では、RTX 5070で毎秒53〜94トークンでした。必要な機械は、GPUメモリー12GB以上、RAM32GB以上、空き容量約80GBです。モデルのダウンロードは約70GBです。初回はPCが1〜3分ほど重くなることもあります。

大事なのは、会社のサーバーを使わず、PCでAIを動かせる点です。ただし、どのPCでも同じ速さになるわけではありません。回答の質も、モデルの版や仕事の種類で変わります。これからは、同じ条件での独立した比較が必要です。

💬 Qwen 3.8 Flash Nextは速いが、設定で結果が変わる

HNでは、Strataを使えば大きなQwenモデルを家庭用機材で動かせるという報告が出ている。ただし、速さと正確さは同じ条件で比べられていない。

  • 利用者の自己申告では、RTX 4090で約124 tokens/s、GPUなしで約7 tokens/sという例がある。機材や圧縮方法が違うので、数字をそのまま比較はできない。
  • 一部の利用者は、125BのFlash NextやCoder版が27B版よりコーディングに強いと感じている。READMEを引用したコメントでは、Coder版は作者測定でフルモデルのSWE-bench Verifiedの91%、RAM 32GBとされる。
  • 一方で、27B版の方が正確だという報告や、4-bitの27Bが3-bitのFlashを上回ったという報告もある。低ビット量子化は速くて小さくなるが、2-bitなどでは品質が落ちることがある。
  • 長い文章を扱うときの結果も一致しない。262K文脈まで良いという人がいる一方、150K前後でスペルミスや指示無視を経験し、設定が原因かもしれないと考えた人もいる。
  • 比較には共通ベンチマークが必要で、導入時はリモートのインストールスクリプトやsudoを無条件に信用せず、コードと配布物を確認するべきだという議論もある。

コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

大きなAIが、おうちのパソコンに入った?

📰 しっかり版: 1250億パラメーターのAIを自宅で動かす Strataが見せた「大きさ」のからくり

ゲーム用のパソコンで、大きなAIを動かすお話です。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Strata(ストラタ)

大きなAIをパソコンで動かすソフトです。

トークン(とーくん)

AIが読む文の小さな区切りです。

Hacker News(ハッカー・ニュース)

技術のニュースをみんなで話す場所です。

Strata(ストラタ)は、大きなAIを家のパソコンで動かすソフトです。 Qwen3.8-Flash-Next(クウェン)は、文を作るAIです。 このAIには、1250億個の調整値があります。

大きなAIは、たくさんの場所を使います。 Strataは、パソコンの場所を分けて使います。 絵を出す部品も使います。 覚える場所も使います。 保存する場所も使います。

AIには、専門の小さな係がたくさんいます。 毎回、全部の係は呼びません。 必要な係だけを呼びます。 だから家のパソコンでも動かせます。

投稿した人は、毎秒124トークンと書きました。 トークンは、AIが読む文の小さな区切りです。 Hacker News(技術ニュースの掲示板)でも話題になりました。 人気の点は600をこえました。 書き込みは300件近くありました。 これは、みんなが話した数です。 AIの速さを証明する数ではありません。

動かすには、約70GBのデータがいります。 最初はパソコンが1〜3分重くなることがあります。 別のパソコンでは、速さが変わるかもしれません。

💬 大きなAIを家のパソコンで動かせる?

Strataを使うと、とても大きなAIを家の機械で動かせることがある。でも、速さと賢さは機械の設定で変わる。

  • ある人はRTX 4090で約124 tokens/s、別の人はGPUなしで約7 tokens/sだった。これは利用者の自己申告で、同じテストではない。
  • このAIが小さな27B版より良いと言う人もいれば、圧縮を少なくした27B版の方が正確だと言う人もいる。どちらがいつも勝つわけではない。
  • AIを小さく圧縮すると速く動くが、圧縮しすぎると間違いが増えることがある。長い会話やインストール用スクリプトは、人が確認する必要がある。

コメント339件時点の成長中(改訂2)。300件を取得し、全体から120件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考