MicroLLM Lab、ブラウザーが小さなAIの実験室になる
WebGPU(ウェブジーピーユー)
ブラウザーが端末の計算チップを使う仕組み。
Q4量子化(キューフォーりょうしか)
AIの数値を4ビットに縮め、保存する大きさを減らす方法。
IndexedDB(インデックスドディービー)
ブラウザーが端末内にデータを保存する場所。
何が起きたか
MicroLLM Lab(ブラウザーで小さな言葉のAIを動かす公開実験)は、速さと答えの質を比べる場だ。APIキーやPython、CUDAの準備は要らない。Safari、Chrome、EdgeのWebGPUで、端末のGPUを使う。モデルは先にダウンロードし、ブラウザーのIndexedDBに保存する。プロジェクトの説明では、入力は端末の外へ送られない。
技術ニュースを話すサイト、Hacker Newsでは139ポイント、65コメントを集めた。ただし、これはコミュニティの注目度だ。実験結果やモデルの正しさを証明する数字ではない。
背景と仕組み
大きなAIは、遠くのデータセンターで計算することが多い。MicroLLM Labは、その計算の一部を自分の機械へ移す。Q4量子化で、AIの数値を4ビットに縮めるため、モデルのファイルを小さくできる。
公開リポジトリには、26MパラメータのMiniMind2 Smallから362MのSmolLM2までが並ぶ。ファイルは15〜216MBほどだ。パラメータは、AIが言葉の続き方を覚えるための数値である。
狙いは、小さいAIが大きいAIに勝つことではない。作者も、クラウドのモデルのほうが優れていると説明している。入力を外へ出しにくいこと、通信を待たずに答えを出せること、ダウンロード後にAPI利用料がかからないことを確かめる実験だ。
確認できたこと
公開リポジトリの測定例では、Apple M4のSafariで、PetitGPTが短い挨拶を毎秒115トークンで生成した。SmolLM2 135M Instructは毎秒66トークンだった。後者は遅いが、用意されたテストでは10/14に対して14/20だった。ただしテストの数が同じではない。単純な勝敗ではなく、速さと答えの質の交換条件が見える。
なぜ重要か
この実験は、AIが遠いサービスだけではないことを示す。下書き、通信できない場所での補助、端末内だけで扱いたいメモでは、小さなモデルが役立つ可能性がある。一方で、説明書は計算を間違えたり、事実を作ったりすると明記する。医療やお金など、失敗が困る用途には向かない。
まだ分からないこと
毎秒115トークンという値は、M4、Safari、特定のモデルと設定での例だ。古いPCやスマートフォンでも同じとは限らない。紹介タイトルは7モデルだが、現行READMEにはGPT-2を含む8種類が掲載されている。追加時期は、確認できた資料だけでは分からない。短いテストの点数が、長い仕事の質を表すわけでもない。
次に見る点
見るべきなのは最高速度だけではない。自分の端末での待ち時間、答えの誤り、最初のダウンロード量、対応ブラウザーを比べる必要がある。MicroLLM Labは万能AIではない。速さ、費用、プライバシー、正確さの選び方を手元で学べる教材だ。公開リポジトリと実験ページで条件を確認したい。
小さなAIがブラウザーで動く MicroLLM Labの実験
📰 しっかり版: MicroLLM Lab、ブラウザーが小さなAIの実験室になる
MicroLLM Labは、ブラウザーの中で小さなAIを動かします。速さと答えの質を比べられます。
WebGPU(ウェブジーピーユー)
ブラウザーから機械の計算チップを使う仕組み。
Q4量子化(キューフォーりょうしか)
AIの数値を小さくして、ファイルを軽くする方法。
トークン(トークン)
AIが文章を作るときの小さな単位。
💡 ようするに
- MicroLLM Labは、小さなAIをブラウザーで動かす実験です。
- WebGPUを使うと、自分の機械の計算チップで動きます。
- 速くて便利ですが、間違うこともあります。
MicroLLM Labは、文章を作るAIを試せるページです。大きなAIは、遠くのコンピューターで計算することがあります。質問を送るので、返事まで少し待つこともあります。
この実験では、AIの計算を自分の機械で行います。これをローカルAIと呼びます。入力を外へ送りにくいので、見られたくない下書きにも向きます。通信がなくても使える可能性があります。最初にモデルをダウンロードすれば、AIサービスの利用料もかかりません。
WebGPUは、ブラウザーから計算チップを使う仕組みです。Q4量子化は、AIの数値を小さくして、モデルのファイルを軽くする方法です。公開一覧には、26Mから362Mまでのモデルがあります。
公開説明の例では、Apple M4でPetitGPTが毎秒115トークンを作りました。SmolLM2 135M Instructは毎秒66トークンでした。トークンは、AIが文章を作るときの小さな単位です。速いモデルが、いつも良い答えを出すとは限りません。
技術ニュースを話すサイト、Hacker Newsでも話題になりました。139ポイントと65コメントが付きました。ただし、この数字は注目度の目安です。実験が正しいという証明ではありません。
小さなAIは、計算を間違えたり、知らないことを作ったりします。医療やお金の相談には使わず、答えを人が確かめる必要があります。紹介では7モデルですが、現在の公開説明には8種類が載っています。詳しい条件は公開リポジトリで確認できます。
💬 小さなAIを試すと、速さと弱さがわかる
ブラウザで7つの小型AIを試せるデモです。HNでは面白い実験だが、答えの正しさや使いやすさには注意が必要だと話された。速度や不具合は利用者の報告である。
- 小型AI(SLM)は、文章の分類や気持ちの判定など一つの仕事には向くが、何でも答える助手としては知識や考える力が足りないことがある。
- PetitGPTが2+2を間違え、SmolLM2 360Mがカリフォルニアの人口を間違えたという報告がある。SmolLM2は弱いGPUでも速かったという報告もある。
- GPT-2は2019年の古いモデルで、昔の不安定な答えを見ると、2022年ごろ以降の進歩がわかる。
- 画面は文字が小さく情報が多いという批判があり、作者は約600語の説明とローカルWebサーバーの案内に意味があると説明した。別の人は、人気でもUIが良い証拠ではなく、最初にデモを見せるべきだと反論した。導入説明のGPT-4に関する情報が古い可能性も指摘された。
- Firefox 156.0・Ubuntu・Radeon 860Mでは、ブラウザがGPUを使う仕組みのWebGPUでエラーが出て動かなかったという報告があり、設定を切っても直らなかった。
コメント65件時点の初期(改訂1)。65件を取得し、全体から65件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
ちいさなAIが、ブラウザーでおしゃべりする
📰 しっかり版: MicroLLM Lab、ブラウザーが小さなAIの実験室になる
MicroLLM Labは、小さなAIをブラウザーで動かす実験です。
WebGPU(ウェブジーピーユー)
ブラウザーが機械の計算チップを使う手伝い。
Q4量子化(キューフォーりょうしか)
AIの数字を小さくするやり方。
MicroLLM Lab(ブラウザーで小さな言葉のAIを動かす実験)は、AIに文を作らせます。AIは、次に来そうな言葉を考える機械です。
大きなAIは、遠いコンピューターで動くことがあります。この実験では、自分の機械で動かします。WebGPUは、機械の計算チップを使う手伝いです。
先に小さなAIをダウンロードします。そのあと、ブラウザーが覚えておきます。だから、質問を外へ送らずにすむことがあります。返事も早くなります。
Q4量子化は、AIの数字を小さくするやり方です。小さくすると、置く場所が少なくてすみます。
でも、小さなAIはまちがえます。数を数えまちがうこともあります。知らないことを作ることもあります。
Hacker News(技術の話をするサイト)でも話題になりました。でも、人気と正しさは同じではありません。
実験ページで試せます。大人と一緒に答えを確かめましょう。
💬 小さなAIのおためし
これは、ブラウザで7つの小さなAIを動かしてみる実験です。
- 小さなAIは速いことがあります。でも、計算や人口の答えを間違えることがあります。むずかしい相談より、文章を分けたり気持ちを調べたりする仕事が得意です。
- GPT-2は2019年のAIです。昔の変な答えを見ると、2022年ごろからAIが大きく進んだことがわかります。
- 画面は文字が小さくて見にくい、という人がいました。作った人は、説明は初めての人のためで、約600語だと答えました。でも、人気だから画面が良いとは限らず、最初におためし画面を見せるべきだという人もいました。説明の一部が古いかもしれない、という話もありました。
- Firefox 156.0とUbuntu、Radeon 860Mの組み合わせでは、ブラウザのGPU機能のエラーで動かなかった、という人もいました。数字や不具合は、その人が試した結果です。
コメント65件時点の初期(改訂1)。65件を取得し、全体から65件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 MicroLLM Lab:小型モデルをブラウザで試すと見える速さと限界
HNの議論では、7つの小型言語モデルをブラウザで触れるデモは、モデルの世代差や小型モデルの用途を実感できる一方、万能なチャット相手や厳密な性能ベンチマークではない、という見方が中心だった。速度・誤答・互換性はコメント投稿者の自己申告で、統制された測定ではない。
コメント65件時点の初期(改訂1)。65件を取得し、全体から65件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。