ドイツのAI「Kolibri」は、なぜ「自分の国で動く」ことを目指すのか
オープンウェイト(おーぷんうぇいと)
学習後のモデルの重みを公開し、自分の機械で動かせる形。
主権型AI(しゅけんがたエーアイ)
作る場所や使う場所を自分たちで決め、外部に左右されにくくするAI。
Mixture of Experts(MoE)(ミクスチャー・オブ・エキスパーツ)
入力ごとに一部の処理部分だけを選ぶモデルの作り方。
何が起きたか
Aleph Alpha(ドイツのAI会社)は、ドイツ語と英語を扱う「Kolibri 1」を10月3日に公開した。学習済みの重みを公開するオープンウェイト型で、重みと設定ファイルはApache 2.0で提供される。ドイツとフィンランドの設備で一から学習したとされ、合計781億パラメーターを持つが、1トークンごとに使うのは約34.6億パラメーターだ。
同じ話題のHacker News投稿は149ポイント、88件のコメントを集めた。ただし、これはコミュニティの注目度であり、内容の正しさを証明する数字ではない。
「主権型」の意味
Aleph Alphaがいう主権型AIは、モデルをドイツとフィンランドで作り、欧州とドイツの法律の下で運用し、利用者が自分のサーバーで動かせるという考え方だ。役所や企業の文書を外部サービスへ送らず、外の会社にモデルを止められたり、勝手に変えられたりしにくい。
ただし、外部の技術を一切使っていないわけではない。紹介記事によると、学習データの作成にはGoogleのGemma 4、Mistral-NeMo、Qwen3-32Bも使われた。主権とは、材料がすべて国内産という意味ではなく、管理と決定権をどこに置くかという意味に近い。
中身はどう軽くするか
KolibriはMixture of Experts(MoE)という構造を使う。384個の小さな処理部分から、入力ごとに6個を選ぶ。全体は大きいままでも、毎回すべてを計算しないので、計算量を抑えられる。ただし全体を記憶する必要があり、必要なGPUメモリーは約78GBとされる。
ドイツ語の長い複合語を少ないトークンで読めるよう、専用の分け方も採用した。紹介記事の実験では、ドイツ憲法の文章でGPT-5の分け方より15%少なくなった。長い文章を読む仕組みでは、通常は近くの512トークンを見て、5層に1層だけ全体を見る。学習時の文脈は262,144トークンで、1,048,576トークンまで試されたという。
なぜ重要か
ドイツ語で法律、契約、製造マニュアルを扱い、文書を自分の設備から出したくない組織には、選択肢になりうる。特に、答えが分からないときに「分からない」と言わせる設計や、ドイツ語で考える性能を重視している点が売りだ。
確認できたこと
紹介記事は、Aleph Alphaの技術報告、モデルカード、公開記事をもとにしている。そこでは、約34.6億のパラメーターを使うモデル同士のドイツ語数学評価で、Kolibriが87.5、次点が84.4だったと報告される。また、知らない答えを無理に作らない評価では、Kolibriが答えを控えたり一部だけ答えたりした割合は44%だった。これは評価結果であって、実際の仕事で同じ性能が出る保証ではない。
まだ分からないことと次に見る点
紹介者は、約78GBのGPUが必要で、当時は自分で実モデルを動かしていないと書いている。独立した大規模検証、実際の企業文書での費用や速度、更新後もデータを自分で管理できるかは、まだ確認が必要だ。今後は、公開された重みを第三者が再現できるか、実運用での失敗率と費用がどうなるかを見るべきだ。
出典: 元記事、Hacker Newsの投稿
ドイツで作ったAI「Kolibri」は何が特別?
📰 しっかり版: ドイツのAI「Kolibri」は、なぜ「自分の国で動く」ことを目指すのか
ドイツのAI会社が、ドイツ語を大切にした新しいAIを公開しました。
オープンウェイト(おーぷんうぇいと)
AIが学習で作った数値を公開する方式。
主権型AI(しゅけんがたエーアイ)
使う場所と管理の方法を自分たちで決めるAI。
トークン(とーくん)
AIが文章を読むときの小さな区切り。
💡 ようするに
- Aleph Alpha(ドイツのAI会社)がKolibri 1を公開しました。
- 自分の機械で動かし、文書を外へ出しにくくします。
- Hacker Newsで149ポイント、88件のコメントがありました。これは注目の大きさで、正しさの証明ではありません。
Kolibri 1は、ドイツ語と英語を読むAIです。学習後の数値を公開する、オープンウェイト型です。利用者は、自分のサーバーで動かせます。
この考え方を主権型AIと呼びます。国や会社が、使う場所と管理の方法を自分で決める考えです。法律の文書や会社の設計図を、外のサービスへ送らずにすむ可能性があります。
Kolibriには、ドイツ語向けの工夫もあります。ドイツ語は、長い言葉をつなげて作ることがあります。Kolibriは、そうした長い言葉を少ないトークンで読めるようにしました。同じ機械の記憶でも、より長い文を扱いやすくなります。
ただし、どこでも動く小さなAIではありません。動かすには、約78GBのGPUメモリーが必要だと紹介記事は説明しています。また、学習データの準備には、GoogleやMistralなど外部の技術も使われました。主権型とは、すべてを国内だけで作る意味ではありません。
紹介記事では、ドイツ語の数学問題や、知らない答えを無理に作らない評価が紹介されています。でも、実際の役所や会社で同じ結果になるとは限りません。今後は、費用、速度、安全性、失敗の少なさを確かめる必要があります。
出典: 元記事、Hacker Newsの投稿
💬 KolibriについてのHNコメント:強みと疑問
コメント欄には、ドイツ語に強そうだという評価と、コーディングや比較方法への疑問があった。性能の数字は利用者の自己申告である。
- ドイツ語の文書を読んで考えるのが得意で、専用のドイツ語tokenizerを使い、作り話も少ないという評価がある。これはコメント投稿者の見方で、独立した検証ではない。
- 一方で、覚えている知識が少なく、多くのターンにわたるツール利用が弱く、最良のコーディングエージェントではないという評価もある。
- RTX Pro 6000で試した利用者の自己申告では、考えすぎてトークンを多く使ったが、FP8で約170 token/sだった。アクティブなパラメータは約3Bとされる。
- 別の説明では、Kolibriは78BのMoEでも一度に3.46Bを使い、27Bのdenseモデルは27Bすべてを使う。ベンチマークは高評価もあるが、Qwen3.8 Flashが比較にない、古いQwen3-Next 80B-A3Bと比べているという批判もある。
- 主権モデルを、別のAIのツール呼び出しや最終回答を監査する「信頼アダプター」に使う案がある。安く速く動くことが条件で、まだ提案段階である。
- 支持者は、データセットや学習手順を再現でき、民間企業に頼りすぎないことが重要だと考える。反対者は、オープンソースモデルがあるなら主権モデルは必要なのかと問う。
コメント88件時点の初期(改訂1)。89件を取得し、全体から89件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
ドイツで作られたAI、Kolibriのお話
📰 しっかり版: ドイツのAI「Kolibri」は、なぜ「自分の国で動く」ことを目指すのか
Aleph Alpha(ドイツのAI会社)が、KolibriというAIを作りました。
主権型AI(しゅけんがたエーアイ)
自分たちの場所で動かし、自分たちで見守るAI。
Hacker News(ハッカー・ニュース)
技術の話をする人が集まるサイト。
Aleph Alphaは、コンピューターの手伝いを作る会社です。 Kolibriは、ドイツ語と英語を読めます。 会社は、これを自分の場所で動かしたいと考えました。 大事なものを、外へ出さずにすむからです。 この考えを、主権型AIと呼びます。 自分たちで見守るAI、という意味です。
Kolibriは、長いドイツ語も読みやすくします。 でも、とても小さなAIではありません。 動かすには、大きな機械がいります。
Hacker Newsという技術のサイトでも話題になりました。 話題でも、ほんとうに正しいとは限りません。 本当に役立つかは、これから仕事で確かめます。
出典: 元記事、Hacker Newsの投稿
💬 Kolibriの話を、5歳向けに
これは、ドイツ語のAIについてのコメントのまとめです。数字は、試した人がそう言ったという報告です。
- ドイツ語の文章を読むのが得意そうだ、作り話が少なそうだ、という声がありました。でも、覚えていることや道具の使い方、プログラム作りは弱いという声もありました。
- 試した人の自己申告では、考えすぎて言葉をたくさん使いました。でも、FP8で1秒に約170 token、アクティブな部分は約3Bでした。27Bのモデルは27B全部を使い、Kolibriは78Bでも3.46Bを使う、という説明もあります。
- ベンチマークがすごいという人もいました。でも、比べる相手が古い、Qwen3.8 Flashが入っていない、という指摘もありました。
- 主権AIは、別のAIの答えを見張る役にできるかもしれません。必要だという人は自分たちでデータと作り方を持ちたいと考え、不要ではという人はオープンソースで足りるかもしれないと考えています。
コメント88件時点の初期(改訂1)。89件を取得し、全体から89件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 HN議論まとめ:Kolibriのドイツ語能力と主権AIの価値
コメント欄では、ドイツ語文書の理解・推論を評価する声と、コーディングやベンチマーク比較への批判が並んだ。性能値や不具合は利用者の自己申告、モデル規模はコメント内の説明として扱う。
コメント88件時点の初期(改訂1)。89件を取得し、全体から89件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。