🔥 HNで話題

Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み

約3分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
推論エンジン(すいろんエンジン)

AIが入力をもとに答えを作る計算ソフト。

カーネル(カーネル)

同じ計算を繰り返す小さなソフト部品。

Hacker News(ハッカー・ニュース)

技術ニュースについて話すサイト。

何が起きたか

Magnitude(AIモデルを自分のコンピューターで動かす、オープンソースの推論エンジン)が公開された。対象は、AIエージェント(目的に向けて複数の作業を進めるAI)だ。Magnitudeは、使う機械を調べ、その機械に合わせて計算の方法を整えると説明している。

公開リポジトリは、llama.cppと比べて、公開モデルを最大2倍速く動かせると主張する。この数字はMagnitude側の比較値であり、すべての機械で同じ結果になるという意味ではない。この話は、Hacker News(技術ニュースを議論するサイト)で123 points、56 commentsを集めた。これはコミュニティの注目度であって、性能の正しさを証明する数字ではない。

しくみ

多くの汎用ツールは、いろいろな機械で動くよう、あらかじめ広い範囲向けの計算コードを用意する。MagnitudeのFAQによれば、llama.cpp、Ollama、LM Studioなどはこの方式だ。Magnitudeは、モデルを動かす前に、実際の機械でカーネル(同じ計算を繰り返す小さなソフト部品)をコンパイルし、調整する。特定のチップに合わせて準備するため、機械の違いを計算に反映しやすい。

さらに、Pi、OpenCode、Hermes、Codexなどのエージェントを、デスクトップアプリからつなげられるとしている。対応しない道具も、OpenAI互換APIを通せると説明する。

なぜ重要か

AIを自分の機械で動かすときは、モデルの大きさだけでなく、チップの種類や使えるメモリも関係する。Magnitudeの説明どおりなら、機械ごとの調整で、返事を作る時間を短くしたり、同時に動かせる作業を増やしたりできる可能性がある。

リポジトリの比較では、Metal上のデコードが92%速く、CUDA上では19%速いとされる。デコードは、答えを少しずつ作る段階だ。図には、最初に入力を読み込む段階も、Metalで9%、CUDAで23%速いとある。また、エージェント1体あたりのメモリ使用量を27%減らせると説明している。

確認できたこと

Magnitudeは、macOS、Linux、Windowsに対応する。Apple Silicon、NVIDIA、AMDのGPUに加え、CPUだけの機械も対象だ。固定された最低スペックはなく、小さい機械では小さいモデルを、大きなメモリがあれば大きなモデルを使う設計になっている。

READMEは、プロンプト、ファイル、モデルが自分の機械に残り、モデルをダウンロードした後はインターネットが不要だと説明する。オープンソースで、ライセンスはApache 2.0。トークン料金なしで使えることも特徴として挙げている。

まだ分からないこと

最大2倍という数字は、どのモデルを、どの機械で、どんな設定で測ったのかを一つの数字だけでは判断できない。Metalで92%速いという結果も、すべてのApple製チップにそのまま当てはまるとは限らない。コンパイルや調整にかかる時間、温度、長時間の安定性も、利用者が確かめる必要がある。

また、対応モデルやエージェントの範囲が、今後どの速さで広がるかもまだ見えない。ローカルで動くことと、すべての作業を快適にこなせることは同じではない。

次に見る点

次は、第三者が同じ機械とモデルで測った結果に注目したい。llama.cppだけでなく、OllamaやLM Studioとの条件をそろえた比較も必要になる。対応モデルの増加、初回の調整時間、複数エージェントを動かしたときのメモリ使用量も重要だ。

Magnitudeが示したのは、AIの速さをモデルだけで競うのではなく、使う機械に合わせたソフトウェアでも競う道である。数字をそのまま一般化せず、実際の環境で確かめる段階にある。

出典: Magnitudeの公開リポジトリ / 反応: Hacker Newsの投稿

💬 Magnitudeはエージェント向け推論を速くするが、実機比較はまだ割れている

Magnitudeは、実行先の機器に合わせて推論カーネルを調整し、長い文脈を持つエージェント処理を効率化する設計。開発者側のベンチマークと利用者の自己申告には差があり、モデル・GPU・文脈長をそろえた再検証が必要。

  • 仕組み:開発者の説明では、高水準のカーネルに調整可能なパラメーターを持たせ、対象機器で自動調整する。新しいモデルごとの調整は通常1回で約1分としている。
  • 事業モデル:将来は、ローカルモデルとクラウドモデルを同じ作業で切り替え、プレフィックスキャッシュを保ったまま使えるハイブリッド推論を提供し、クラウド側をトークン単位で課金する構想。現時点はエンジンの改善に注力している。
  • 技術上の主張:モデルごとに投機的デコーディング用のドラフターモデルを割り当て、KVキャッシュをキー8-bit・値4-bitに量子化する。開発者はKVメモリを半分超削減し、長文脈のデコードを速くし、RULERベースの検索試験で文脈保持への悪影響が見えないと説明している。これは開発者側の結果。
  • 比較条件:開発者が示したllama.cpp比較は、『Moby Dick』を最大64K文脈まで入れて最後の節を繰り返させる単純な文章反復。llama.cppには近い設定、投機的デコーディングなし、標準のprefill batch、Flash Attention有効を使い、8-bit/4-bit KVで速度が落ちたため16-bit KVを採用したとしている。
  • 有力な反論:利用者の自己申告では、既存エンジンの弱点は最良の投機的デコーディングを使わないこと、KVキャッシュのVRAM消費、現実的な100〜200K文脈での速度低下。開発者はMagnitudeがこの3点を直接狙い、長文脈を重視すると応じている。
  • 実機比較:利用者の自己申告では、5070 Tiでllama.cppのdecodeがMagnitudeより20〜30%速かった。またM5 MaxのQwen 3.8 UD-Q6-K-XLでは、llama.cpp(b10853以降)がMagnitude 0.2.1よりprefill・decodeともおよそ2倍速かった。開発者はM5のMetal 4の行列積利用不足の可能性を挙げ、UIの速度は実測ではなく、投機的デコーディングの効果も含まない目安だと説明している。
  • ハードウェア上の制限:利用者の自己申告では、16GB+16GBの2GPUが4GPUと表示され、8GB超のモデルが大きすぎる扱いになり、5070 Ti 1枚だけが使われた。開発者は現時点でマルチGPU未対応で、モデル容量の判定表示は不具合かもしれないとしている。
  • 評価の未解決点:別の利用者は、単純なベンチマークではなく、複数段のツール呼び出しを含む実際のエージェント履歴で評価したかを尋ねている。提示されたコメント群には回答がなく、エージェント用途での優位性はまだ確定していない。

コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Magnitude(AIを動かす道具)が、使うコンピューターに合わせて速くなる

📰 しっかり版: Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み

AIを自分のコンピューターで使う人向けの道具が公開されました。機械ごとに計算方法を調整します。

約2分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
AIエージェント(AIエージェント)

いくつかの作業を順番に進めるAI。

カーネル(カーネル)

AIの計算を担当する小さなソフト部品。

Hacker News(ハッカー・ニュース)

技術ニュースについて話すサイト。

💡 ようするに

  • Magnitudeは、使う機械に合わせてAIの計算を調整します。
  • llama.cppより最大2倍速いと、開発者は説明しています。
  • Hacker Newsで123 points、56 commentsが集まりました。

Magnitude(AIモデルを動かすオープンソースの道具)は、AIエージェント向けです。AIエージェントは、いくつかの作業を順番に進めるAIです。

これまでの汎用ツールは、いろいろな機械で使える計算コードを用意していました。Magnitudeは、使う人の機械で、そのコードを作り直して調整します。機械に合う計算になりやすい仕組みです。

この作業で使う小さなソフト部品を、カーネルと呼びます。Magnitudeは、カーネルを実際の機械に合わせます。だから、同じAIモデルでも返事が速くなる可能性があります。

開発者の比較では、Metalで返事を作る段階が92%速くなりました。CUDAでは19%速くなりました。エージェント1体あたりのメモリ使用量は、27%少ないと説明しています。これはMagnitude側の比較です。すべての機械で同じ数字になるとは限りません。

Magnitudeは、macOS、Linux、Windowsで使えます。Apple Silicon、NVIDIA、AMDのGPUに対応します。CPUだけの機械も対象です。質問やファイルは自分の機械に残り、モデルを入れた後はインターネットなしで使えると説明しています。

この話は、Hacker Newsという技術ニュースのサイトで話題になりました。123 pointsと56 commentsは、コミュニティの注目度を示します。速さが本当だと証明する数字ではありません。

これからは、別の人が同じ条件で測った結果が大切です。どのAIモデルで速いのかも、確かめる必要があります。

出典: Magnitudeの公開リポジトリ / 反応: Hacker Newsの投稿

💬 有望なローカル推論エンジンだが、速さは機械ごとに違う

Magnitudeは、使うコンピューターに合わせてAIの動かし方を変える仕組み。開発者の狙いは明確だが、利用者の自己申告では結果が一様ではない。

  • Magnitudeは、コンピューターに合わせてAIの計算部品を自動調整する。開発者によると、新しいモデルの準備は通常1回で約1分。
  • 将来は、手元のモデルとクラウドのモデルを切り替えるサービスにし、前半の計算結果であるプレフィックスキャッシュを保ったまま、使ったトークン分だけ課金する予定。
  • 開発者は、KVキャッシュという長い文を覚える作業メモリを、キー8-bit・値4-bitにして半分超減らし、次の言葉を先読みする機能も使うと説明している。RULERという文脈保持テストでは、悪影響が見えなかったとしている。
  • 主な比較は、『Moby Dick』を64Kまで読ませて最後を繰り返す試験だった。利用者の自己申告では、100〜200Kの長い文脈では、先読みやKVメモリの使い方が重要だという反論がある。
  • 利用者の自己申告では、5070 Tiでllama.cppが20〜30%速く、M5 Maxの別の比較では約2倍速かった。開発者は、画面の速度は目安で、M5向けの改善余地もあると説明している。
  • 利用者の自己申告では、2枚のGPUが4枚と表示され、1枚しか使われない例もあった。開発者は現在マルチGPUに対応していない。実際の複数回のツール利用でどうなるかも、このコメント群では未回答。

コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Magnitude(AIの返事を作る道具)は、コンピューターに合わせて走る

📰 しっかり版: Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み

AIを動かす新しい道具ができました。使う機械に合わせて動きます。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Magnitude(マグニチュード)

コンピューターに合わせてAIを動かす道具。

Hacker News(ハッカー・ニュース)

技術の話をするサイト。

Magnitude(AIの返事を作る道具)が公開されました。

AIは、質問を見て返事を作ります。 その仕事には、コンピューターの力を使います。

コンピューターには、いろいろな種類があります。 Magnitudeは、使う機械を見ます。 そして、その機械に合う動き方を準備します。

llama.cpp(別のAI用の道具)より、最大2倍速いと説明しています。 これは、作った人たちのくらべっこです。 すべての機械で同じ速さとは限りません。

質問やファイルは、機械の中に残ると説明しています。 モデルを入れた後は、ネットなしで使えるそうです。

Hacker News(技術の話をするサイト)でも話題になりました。 123 pointsと56 commentsがつきました。 これは、話題の大きさを表す数字です。 速さが本当だと証明する数字ではありません。

これから、いろいろな機械で試します。 本当にどれくらい速いかを調べます。

💬 AIを速く動かす道具。でも結果は機械しだい

Magnitudeは、コンピューターに合わせてAIの動かし方を変える道具。まだ、どの機械でも一番速いとは分からない。

  • Magnitudeは、AIの計算を使う機械に合わせる。開発者は、新しいモデルの準備は約1分だと説明している。
  • 開発者は、長い文章を覚えるメモリを8-bitと4-bitにして少なくし、次の言葉を先に考える機能も使うと説明している。テストでは、長い文章を忘れにくかった。将来は手元とクラウドを切り替え、使った分だけ払う予定。
  • 試験は『Moby Dick』を64Kまで読ませて繰り返すものだった。100〜200Kの長い文章や、何度も道具を使う本物の仕事で同じ結果になるかは、まだ分からない。
  • 利用者の自己申告では、5070 Tiでllama.cppが20〜30%速い例と、M5 Maxで約2倍速い例があった。2枚のGPUがうまく使われなかった例もあり、開発者は今は複数GPUに対応していないと説明している。

コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考