🔥 HN 热议

德国 Kolibri:为什么它强调在自己的控制下运行

约2分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
主权型人工智能

由使用者决定模型在哪里运行,以及由谁管理。

混合专家

每次只选择部分网络来处理输入的模型结构。

分词器

把文章切成模型可以读取的小片段的工具。

发生了什么

德国 AI 公司 Aleph Alpha 在10月3日发布了 Kolibri 1。它面向德语和英语,是一种开放权重模型。也就是说,学会后的模型权重可以公开,让用户在自己的设备上运行。消息称,它在德国和芬兰的基础设施上从头训练,权重和配置文件采用 Apache 2.0 许可。它总共有781亿个参数,但每个词元只调用约34.6亿个。

相关帖子在 Hacker News 获得149个积分和88条评论。这说明技术社区很关注它,不等于证明它一定正确或好用。

什么是主权型人工智能

Aleph Alpha把主权型人工智能解释为两层控制。第一,团队在德国和芬兰开发和训练模型,并在德国和欧洲法律下工作。第二,客户可以把模型放在自己的服务器上。政府部门或公司可以让文件留在内部,不必完全依赖外部云服务。

但这不代表所有材料都来自德国。原文说,英语数据曾用 Google 的 Gemma 4 改写,德语数据用了 Mistral-NeMo,质量筛选还使用了 Qwen3-32B 的标注数据。所以,这里的主权更接近于控制开发、部署和使用地点,而不是完全隔绝外部技术。

它怎样减少计算

Kolibri采用混合专家结构。每一层有384个专家网络和一个共享网络。路由器会根据每个词元选择6个专家。这样,每次计算只激活一部分网络。可是,完整模型仍要放进内存,所需 GPU 显存约为78GB。

它的分词器还专门照顾德语的长合成词。原作者在德国基本法文本上的测试称,Kolibri比 GPT-5 的分词方式少用15%的词元。模型的大部分层只看附近的512个词元,每5层有1层可以看更早的完整上下文。原生上下文长度是262144个词元,文章称它测试到了1048576个词元。

为什么重要

政府、银行、工厂和医院都可能拥有很长、很私密的德语文件。若模型能在自己的设备上运行,组织就能减少把文件交给外部服务的需要。Kolibri还把德语推理,以及不知道答案时承认不确定,作为主要卖点。

哪些结果已经看到

这篇解说参考了 Aleph Alpha 的技术报告、模型卡和发布文章,也加入了原作者的分词器实验。文章引用的评测显示,在使用约34.6亿个参数的模型中,Kolibri的德语 AIME 2025 得分为87.5,下一名为84.4。另一个关于不知道答案时是否会乱答的测试中,Kolibri有44%的情况会保留答案或只给出部分答案。这些是报告中的评测结果,不是每个工作场景的保证。

哪些仍不清楚

原作者当时还没有亲自运行模型,并说它需要很大的 GPU 设备。独立测试还要确认真实文件上的速度、费用、稳定性和安全性。还要观察以后更新模型时,用户是否仍能清楚地知道数据由谁控制。

接下来观察什么

真正的问题是,主权型人工智能能否在日常工作中保持它的承诺。接下来应关注可重复的第三方评测、真实部署、运行成本、失败率,以及训练数据的管理方式。Kolibri可能适合某些德语任务,但不代表它适合所有任务。

来源:技术解说原文、Hacker News帖子

💬 HN 评论总结:Kolibri 的德语能力与主权 AI 争论

评论者一方面肯定 Kolibri 对德语文档的理解和推理,另一方面质疑它的编程、工具调用和基准测试方式。性能数字和问题报告来自用户自报,模型规模数字来自评论中的解释。

  • 一些评论认为,Kolibri擅长阅读德语文档并据此推理,使用了定制的德语分词器,而且较少产生幻觉。这只是评论者的评价,并非独立验证。
  • 另一些评论认为,它记忆中的知识较少,多轮工具调用较弱,也不是最强的编程代理。
  • 一位在 RTX Pro 6000 上测试的用户自报称,模型即使找到了正确方法,也会想得过多、消耗太多 token;但在 FP8 下速度约为每秒170 token,激活参数约为3B。
  • 关于参数量,评论中的一种解释是:27B 稠密模型每次都会使用全部27B参数,而 Kolibri 被描述为总量78B的 MoE 模型,但每次只激活3.46B。因此,所谓更大,可能指总参数,也可能指每次实际使用的参数。
  • 有人认为,考虑到目标问题领域,这些基准成绩很亮眼;也有人批评它没有与 Qwen3.8 Flash 比较,而是使用了将近一年前发布的 Qwen3-Next 80B-A3B 作为对照。
  • 有人提出,主权模型可以作为信任适配器,检查另一个模型的工具调用和最终答案,前提是它足够便宜、快速。这仍是设想,不是已证明的结果。
  • 支持者认为,只有开放权重还不够;还需要可复现的数据集、训练流程和对整套技术栈的控制,以减少对私人公司的依赖,并更好地处理本地工作方式和价值观。
  • 反对者则问:既然已经有开源模型,为什么还需要主权模型?因此,争论不仅是能力高低,也涉及谁能控制数据、训练和运行方式。

这是评论数为88时的初期(修订1)。获取89条,并从整体抽取89条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

德国 AI Kolibri 有什么特别之处?

📰 完整报道: 德国 Kolibri:为什么它强调在自己的控制下运行

德国 AI 公司 Aleph Alpha 发布了一个重视德语和本地运行的模型。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
开放权重

把模型学会的权重公开,让用户可以自己运行。

主权型人工智能

使用者自己决定模型在哪里运行和怎样管理。

分词器

把长文章切成模型能读取的小片段的工具。

💡 一句话总结

  • Kolibri 1可以读德语和英语。
  • 它可以放在用户自己的机器上运行。
  • Hacker News有149个积分和88条评论。这表示受到关注,不证明一定正确。

Kolibri 1是一种开放权重模型。用户可以取得它学会的模型权重,再放到自己的设备上运行。这对政府、银行和工厂很重要,因为它们常有不能随便外传的文件。

Aleph Alpha把这种做法叫作主权型人工智能。意思是,使用者自己决定模型在哪里运行,也自己决定谁来管理它。文件可以留在内部,不必全部送去外部云服务。

不过,开放权重不表示所有技术都来自德国。介绍文章说,训练数据的准备使用过 Google、Mistral 和 Qwen 的技术。主权主要说的是控制权,不是完全不使用外部材料。

Kolibri还使用混合专家结构。它不会每次都使用模型的全部部分,所以可以减少一些计算。可是,它仍然需要约78GB的 GPU 显存。它的分词器也特别照顾德语长词,帮助它用较少的词元阅读长文件。

介绍文章引用了德语数学测试和不知道答案时的测试。可是,原作者当时还没有亲自运行模型。以后还要检查真实工作中的速度、费用、安全性和失败情况。

来源:技术解说原文、Hacker News帖子

💬 HN 评论里的 Kolibri:优点和疑问

评论者赞赏它可能擅长德语,也质疑它的编程能力、比较方法以及主权 AI 是否必要。性能数字是用户自报。

  • 有人说 Kolibri 擅长阅读德语文档和推理,使用德语分词器,胡编内容较少。这还没有经过独立验证。
  • 也有人说它记住的知识较少,多轮使用工具较弱,不是最好的编程代理。
  • 一位在 RTX Pro 6000 上测试的用户自报称,模型想得太多,但 FP8 速度约为每秒170 token,激活参数约为3B。评论还解释说,Kolibri总量78B却只激活3.46B,而27B稠密模型会使用全部27B。
  • 有人称赞基准测试,也有人指出没有比较 Qwen3.8 Flash,并且对照模型 Qwen3-Next 80B-A3B 较旧。
  • 一个想法是让主权模型检查另一个 AI 的工具调用和答案,像一个信任适配器。支持者想自己掌握数据和训练流程;反对者认为开源模型也许已经够用。

这是评论数为88时的初期(修订1)。获取89条,并从整体抽取89条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

德国的小电脑帮手 Kolibri

📰 完整报道: 德国 Kolibri:为什么它强调在自己的控制下运行

Aleph Alpha(德国的人工智能公司)做了 Kolibri。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
主权型人工智能

自己决定电脑帮手在哪里工作。

Hacker News

技术人分享和讨论消息的网站。

人工智能就是会帮忙的电脑。 Kolibri是会读德语和英语的电脑帮手。 公司想让它在自己的地方工作。 这样,重要的东西不用送到别处。

这种想法叫主权型人工智能。 意思是自己决定怎样使用它。 Kolibri还可以读很长的德语。 可是它不是小小的电脑玩具。 它需要很大的机器。

Hacker News是技术人聊天的网站。 很多人谈到了 Kolibri。 谈得多,不表示它一定做得好。 还要在真正的工作里检查。

来源:技术解说原文、Hacker News帖子

💬 给五岁孩子讲 Kolibri

这是人们讨论一种德国 AI 的故事。数字是试过它的人自己报告的。

  • 有人觉得它很会读德语,比较少胡编答案。也有人觉得它记东西、用工具和写程序不够好。
  • 一位测试者说它想得太久,浪费了很多小文字片段。但他报告说,FP8下每秒约170个 token。评论还说,Kolibri有78B参数,却一次只用3.46B;另一个27B模型会一次用完27B。
  • 有人说它的考试成绩很好。也有人说比较时漏了 Qwen3.8 Flash,还用了较旧的 Qwen3-Next 80B-A3B。
  • 主权 AI 可以帮忙检查另一个 AI 的答案。支持者想自己保管数据和训练方法;反对者问,开源 AI 会不会已经足够。

这是评论数为88时的初期(修订1)。获取89条,并从整体抽取89条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源