Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み
推論エンジン(すいろんエンジン)
AIが入力をもとに答えを作る計算ソフト。
カーネル(カーネル)
同じ計算を繰り返す小さなソフト部品。
Hacker News(ハッカー・ニュース)
技術ニュースについて話すサイト。
何が起きたか
Magnitude(AIモデルを自分のコンピューターで動かす、オープンソースの推論エンジン)が公開された。対象は、AIエージェント(目的に向けて複数の作業を進めるAI)だ。Magnitudeは、使う機械を調べ、その機械に合わせて計算の方法を整えると説明している。
公開リポジトリは、llama.cppと比べて、公開モデルを最大2倍速く動かせると主張する。この数字はMagnitude側の比較値であり、すべての機械で同じ結果になるという意味ではない。この話は、Hacker News(技術ニュースを議論するサイト)で123 points、56 commentsを集めた。これはコミュニティの注目度であって、性能の正しさを証明する数字ではない。
しくみ
多くの汎用ツールは、いろいろな機械で動くよう、あらかじめ広い範囲向けの計算コードを用意する。MagnitudeのFAQによれば、llama.cpp、Ollama、LM Studioなどはこの方式だ。Magnitudeは、モデルを動かす前に、実際の機械でカーネル(同じ計算を繰り返す小さなソフト部品)をコンパイルし、調整する。特定のチップに合わせて準備するため、機械の違いを計算に反映しやすい。
さらに、Pi、OpenCode、Hermes、Codexなどのエージェントを、デスクトップアプリからつなげられるとしている。対応しない道具も、OpenAI互換APIを通せると説明する。
なぜ重要か
AIを自分の機械で動かすときは、モデルの大きさだけでなく、チップの種類や使えるメモリも関係する。Magnitudeの説明どおりなら、機械ごとの調整で、返事を作る時間を短くしたり、同時に動かせる作業を増やしたりできる可能性がある。
リポジトリの比較では、Metal上のデコードが92%速く、CUDA上では19%速いとされる。デコードは、答えを少しずつ作る段階だ。図には、最初に入力を読み込む段階も、Metalで9%、CUDAで23%速いとある。また、エージェント1体あたりのメモリ使用量を27%減らせると説明している。
確認できたこと
Magnitudeは、macOS、Linux、Windowsに対応する。Apple Silicon、NVIDIA、AMDのGPUに加え、CPUだけの機械も対象だ。固定された最低スペックはなく、小さい機械では小さいモデルを、大きなメモリがあれば大きなモデルを使う設計になっている。
READMEは、プロンプト、ファイル、モデルが自分の機械に残り、モデルをダウンロードした後はインターネットが不要だと説明する。オープンソースで、ライセンスはApache 2.0。トークン料金なしで使えることも特徴として挙げている。
まだ分からないこと
最大2倍という数字は、どのモデルを、どの機械で、どんな設定で測ったのかを一つの数字だけでは判断できない。Metalで92%速いという結果も、すべてのApple製チップにそのまま当てはまるとは限らない。コンパイルや調整にかかる時間、温度、長時間の安定性も、利用者が確かめる必要がある。
また、対応モデルやエージェントの範囲が、今後どの速さで広がるかもまだ見えない。ローカルで動くことと、すべての作業を快適にこなせることは同じではない。
次に見る点
次は、第三者が同じ機械とモデルで測った結果に注目したい。llama.cppだけでなく、OllamaやLM Studioとの条件をそろえた比較も必要になる。対応モデルの増加、初回の調整時間、複数エージェントを動かしたときのメモリ使用量も重要だ。
Magnitudeが示したのは、AIの速さをモデルだけで競うのではなく、使う機械に合わせたソフトウェアでも競う道である。数字をそのまま一般化せず、実際の環境で確かめる段階にある。
出典: Magnitudeの公開リポジトリ / 反応: Hacker Newsの投稿
Magnitude(AIを動かす道具)が、使うコンピューターに合わせて速くなる
📰 しっかり版: Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み
AIを自分のコンピューターで使う人向けの道具が公開されました。機械ごとに計算方法を調整します。
AIエージェント(AIエージェント)
いくつかの作業を順番に進めるAI。
カーネル(カーネル)
AIの計算を担当する小さなソフト部品。
Hacker News(ハッカー・ニュース)
技術ニュースについて話すサイト。
💡 ようするに
- Magnitudeは、使う機械に合わせてAIの計算を調整します。
- llama.cppより最大2倍速いと、開発者は説明しています。
- Hacker Newsで123 points、56 commentsが集まりました。
Magnitude(AIモデルを動かすオープンソースの道具)は、AIエージェント向けです。AIエージェントは、いくつかの作業を順番に進めるAIです。
これまでの汎用ツールは、いろいろな機械で使える計算コードを用意していました。Magnitudeは、使う人の機械で、そのコードを作り直して調整します。機械に合う計算になりやすい仕組みです。
この作業で使う小さなソフト部品を、カーネルと呼びます。Magnitudeは、カーネルを実際の機械に合わせます。だから、同じAIモデルでも返事が速くなる可能性があります。
開発者の比較では、Metalで返事を作る段階が92%速くなりました。CUDAでは19%速くなりました。エージェント1体あたりのメモリ使用量は、27%少ないと説明しています。これはMagnitude側の比較です。すべての機械で同じ数字になるとは限りません。
Magnitudeは、macOS、Linux、Windowsで使えます。Apple Silicon、NVIDIA、AMDのGPUに対応します。CPUだけの機械も対象です。質問やファイルは自分の機械に残り、モデルを入れた後はインターネットなしで使えると説明しています。
この話は、Hacker Newsという技術ニュースのサイトで話題になりました。123 pointsと56 commentsは、コミュニティの注目度を示します。速さが本当だと証明する数字ではありません。
これからは、別の人が同じ条件で測った結果が大切です。どのAIモデルで速いのかも、確かめる必要があります。
出典: Magnitudeの公開リポジトリ / 反応: Hacker Newsの投稿
💬 有望なローカル推論エンジンだが、速さは機械ごとに違う
Magnitudeは、使うコンピューターに合わせてAIの動かし方を変える仕組み。開発者の狙いは明確だが、利用者の自己申告では結果が一様ではない。
- Magnitudeは、コンピューターに合わせてAIの計算部品を自動調整する。開発者によると、新しいモデルの準備は通常1回で約1分。
- 将来は、手元のモデルとクラウドのモデルを切り替えるサービスにし、前半の計算結果であるプレフィックスキャッシュを保ったまま、使ったトークン分だけ課金する予定。
- 開発者は、KVキャッシュという長い文を覚える作業メモリを、キー8-bit・値4-bitにして半分超減らし、次の言葉を先読みする機能も使うと説明している。RULERという文脈保持テストでは、悪影響が見えなかったとしている。
- 主な比較は、『Moby Dick』を64Kまで読ませて最後を繰り返す試験だった。利用者の自己申告では、100〜200Kの長い文脈では、先読みやKVメモリの使い方が重要だという反論がある。
- 利用者の自己申告では、5070 Tiでllama.cppが20〜30%速く、M5 Maxの別の比較では約2倍速かった。開発者は、画面の速度は目安で、M5向けの改善余地もあると説明している。
- 利用者の自己申告では、2枚のGPUが4枚と表示され、1枚しか使われない例もあった。開発者は現在マルチGPUに対応していない。実際の複数回のツール利用でどうなるかも、このコメント群では未回答。
コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
Magnitude(AIの返事を作る道具)は、コンピューターに合わせて走る
📰 しっかり版: Magnitude(AIの計算を動かす道具)が、使う機械ごとに速くなる仕組み
AIを動かす新しい道具ができました。使う機械に合わせて動きます。
Magnitude(マグニチュード)
コンピューターに合わせてAIを動かす道具。
Hacker News(ハッカー・ニュース)
技術の話をするサイト。
Magnitude(AIの返事を作る道具)が公開されました。
AIは、質問を見て返事を作ります。 その仕事には、コンピューターの力を使います。
コンピューターには、いろいろな種類があります。 Magnitudeは、使う機械を見ます。 そして、その機械に合う動き方を準備します。
llama.cpp(別のAI用の道具)より、最大2倍速いと説明しています。 これは、作った人たちのくらべっこです。 すべての機械で同じ速さとは限りません。
質問やファイルは、機械の中に残ると説明しています。 モデルを入れた後は、ネットなしで使えるそうです。
Hacker News(技術の話をするサイト)でも話題になりました。 123 pointsと56 commentsがつきました。 これは、話題の大きさを表す数字です。 速さが本当だと証明する数字ではありません。
これから、いろいろな機械で試します。 本当にどれくらい速いかを調べます。
💬 AIを速く動かす道具。でも結果は機械しだい
Magnitudeは、コンピューターに合わせてAIの動かし方を変える道具。まだ、どの機械でも一番速いとは分からない。
- Magnitudeは、AIの計算を使う機械に合わせる。開発者は、新しいモデルの準備は約1分だと説明している。
- 開発者は、長い文章を覚えるメモリを8-bitと4-bitにして少なくし、次の言葉を先に考える機能も使うと説明している。テストでは、長い文章を忘れにくかった。将来は手元とクラウドを切り替え、使った分だけ払う予定。
- 試験は『Moby Dick』を64Kまで読ませて繰り返すものだった。100〜200Kの長い文章や、何度も道具を使う本物の仕事で同じ結果になるかは、まだ分からない。
- 利用者の自己申告では、5070 Tiでllama.cppが20〜30%速い例と、M5 Maxで約2倍速い例があった。2枚のGPUがうまく使われなかった例もあり、開発者は今は複数GPUに対応していないと説明している。
コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 Magnitudeはエージェント向け推論を速くするが、実機比較はまだ割れている
Magnitudeは、実行先の機器に合わせて推論カーネルを調整し、長い文脈を持つエージェント処理を効率化する設計。開発者側のベンチマークと利用者の自己申告には差があり、モデル・GPU・文脈長をそろえた再検証が必要。
コメント56件時点の初期(改訂1)。56件を取得し、全体から56件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。