Magnitude(按电脑硬件调整 AI 运行方式的开源推理引擎)为何想让本地 AI 更快
推理引擎(tuī lǐ yǐn qíng)
让 AI 根据输入生成回答的软件。
内核(nèi hé)
负责反复完成计算的一小段软件。
Hacker News(Hacker News)
讨论技术新闻的网站。
发生了什么
Magnitude(一个会按电脑硬件调整 AI 运行方式的开源推理引擎)公开了面向 AI 代理的运行工具。AI 代理是能够分几步完成目标的 AI。Magnitude 表示,它会先了解实际运行它的电脑,再为这台电脑编译和调整计算代码。
项目的公开仓库称,与 llama.cpp 相比,它让开放模型的运行速度最高提高到两倍。这是 Magnitude 自己公布的比较结果,不代表所有电脑都会得到相同速度。这条 Launch HN 帖子在 Hacker News(讨论技术新闻的网站)获得了 123 points 和 56 comments。它们说明社区很关注这个项目,但不能证明性能数字一定正确。
它怎样提速
很多通用工具会提前编译一套代码,让它适应较大的硬件范围。Magnitude 的常见问题说明,llama.cpp、Ollama 和 LM Studio 采用了这种思路。Magnitude 则会在模型运行前,在用户自己的设备上编译和调整内核。内核是负责反复计算的一小段软件。这样做的目标,是让计算方式更贴合正在使用的芯片。
桌面应用还可以一键连接多个 AI 代理工具。仓库列出了 Pi、OpenCode、Hermes、Codex、OpenClaw、Claude Code、Oh My Pi 和 Cline。其他工具则可以通过兼容 OpenAI 的接口接入。
为什么重要
在电脑本地运行 AI 时,速度不只由模型大小决定。芯片种类、可用内存和同时进行的任务也会影响体验。如果 Magnitude 的说法成立,按设备调整代码可能减少等待时间,也可能让多个代理任务更容易同时运行。
项目公布的比较结果显示,Metal 上的解码速度提高了 92%,CUDA 上提高了 19%。解码是把答案一点点生成出来的阶段。图表还显示,Metal 上先读入输入的阶段提高了 9%,CUDA 上提高了 23%。项目还称,每个代理使用的内存减少了 27%。
Magnitude 还把本地运行、隐私和开源列为特点。它说,提示词、文件和模型会留在用户的电脑里。模型下载完成后,不需要继续连接互联网。仓库使用 Apache 2.0 许可证,并称不会产生 token 费用。
已确认的内容
Magnitude 提供 macOS、Linux 和 Windows 版本。它支持 Apple Silicon、NVIDIA 和 AMD 图形处理器,也支持只使用 CPU 的电脑。它没有规定固定的最低硬件配置。较小的电脑运行较小的模型,更多内存则可以运行更大的模型。
仓库还链接了支持的开放权重模型目录,并列出多种代理工具的连接方式。这些属于项目明确写出的功能。速度数字仍然是项目自己报告的测量结果。
仍不清楚的地方
最高两倍的说法,并不能说明每一次测试的条件。单看 README,无法知道每个数字对应的完整模型、芯片、软件版本、设置和运行时间。Metal 上提高 92%,也不一定会出现在每一台 Apple 设备上。
第一次编译和调整需要多久,也会影响体验。用户还需要知道它会消耗多少热量,长时间运行是否稳定。支持的模型能否继续增加,以及本地隐私表现能否被外部检查,也需要继续观察。
接下来观察什么
接下来应关注第三方测试。测试最好使用相同的模型、设置和电脑,比较 Magnitude、llama.cpp、Ollama 和 LM Studio。支持的新模型、首次调整时间、多个代理同时运行时的内存使用量,也值得观察。
Magnitude 提出了一条不同的本地 AI 路线:不只改模型,也按每台电脑调整运行软件。这个方向可能让本地代理更容易使用。不过,项目的公开性能数字还需要更多独立测试来确认。
来源:Magnitude 公开仓库 · 讨论:Hacker News 帖子
Magnitude(会按电脑调整 AI 的本地工具)想让 AI 跑得更快
📰 完整报道: Magnitude(按电脑硬件调整 AI 运行方式的开源推理引擎)为何想让本地 AI 更快
一个新的开源工具可以在自己的电脑上运行 AI。它会按不同电脑调整计算方式。
推理引擎(tuī lǐ yǐn qíng)
让 AI 在电脑上生成回答的软件。
内核(nèi hé)
反复完成计算的小段代码。
Hacker News(Hacker News)
讨论技术新闻的网站。
💡 一句话总结
- Magnitude 会按正在使用的电脑调整 AI 软件。
- 项目称,它比 llama.cpp 最快可提高两倍速度。
- Hacker News 有 123 points 和 56 comments,说明它受到关注。
Magnitude(一个让 AI 在本地电脑运行的开源推理引擎)面向 AI 代理。AI 代理可以分几步完成一个目标。
很多通用工具使用提前准备好的代码。那些代码要适应很多不同的芯片。Magnitude 会在用户自己的电脑上编译和调整小段计算代码。这样,代码可能更适合这台电脑。
这些小段代码叫作内核。内核会重复完成重要计算。内核更合适,AI 可能就能更快生成回答。
项目称,Metal 上的解码速度提高了 92%。项目称,CUDA 上提高了 19%。解码就是一点点生成回答。每个代理使用的内存还可减少 27%。
Magnitude 支持 macOS、Linux 和 Windows。它支持 Apple Silicon、NVIDIA、AMD 和只使用 CPU 的电脑。它没有固定的最低配置。小电脑运行小模型。内存更多时,可以运行大模型。
项目称,提示词、文件和模型会留在本地电脑。模型下载后,也可以不连接互联网。它使用 Apache 2.0 许可证。
Hacker News 是讨论技术新闻的网站。123 points 和 56 comments 代表社区关注度。它们不是性能证明。速度数字来自 Magnitude 自己的比较。
接下来要看的是,其他人能否用相同条件得到类似结果。不同芯片、不同模型和长时间运行,都需要测试。
来源:Magnitude 公开仓库 · 讨论:Hacker News 帖子
💬 目标很明确,但实际速度因机器而异
Magnitude会按照电脑的硬件改变AI的运行方式。开发者提出了不少优化,但用户自报的结果并不总是更快。
- Magnitude会自动调整计算内核,让模型适应正在使用的电脑。开发者说,新模型通常一次调优约需1分钟。
- 未来计划是按token收费的云服务,让模型在本地和云端之间切换,同时保留前缀缓存,也就是已经算过的前半段。
- 开发者说,它使用推测解码,也就是先猜一部分后续token;还把KV缓存这种长文本工作记忆压缩为8-bit键和4-bit值,内存可减少一半以上。RULER测试据称没有显示明显的记忆问题。
- 主要测试是把《白鲸》放到最多64K上下文中,再重复最后一段。用户自报认为,在100K至200K的超长上下文中,推测解码和KV缓存的处理方式仍可能造成速度下降。
- 用户自报的实机结果有差异:5070 Ti上llama.cpp快20%至30%,另一个M5 Max比较中约快两倍。开发者说界面数字只是估计值,M5还可能有优化空间。
- 用户自报还提到多GPU识别和使用异常。开发者说目前还不支持多GPU。评论中也没有回答真实多步骤工具调用是否更快。
这是评论数为56时的初期(修订1)。获取56条,并从整体抽取56条总结。内容属于HN用户自述,并非编辑部核实的事实。
Magnitude(帮助电脑运行 AI 的工具)会适应每台电脑
📰 完整报道: Magnitude(按电脑硬件调整 AI 运行方式的开源推理引擎)为何想让本地 AI 更快
AI 会在电脑里做回答。Magnitude 想让这个过程更快。
Magnitude(Magnitude)
帮助电脑运行 AI 的工具。
Hacker News(Hacker News)
人们谈论技术的网站。
Magnitude(帮助电脑运行 AI 的工具)公开了。
AI 会在电脑里做回答。 有些电脑做得快。 有些电脑做得慢。
Magnitude 会先看看正在用的电脑。 然后按这台电脑准备工作。 这样,AI 可能回答得更快。
项目说,它比 llama.cpp 这种 AI 工具最快快两倍。 这是项目自己做的测试。 每台电脑不一定一样快。
问题、文件和模型会留在电脑里。 模型下载后,可以不用网络。
Hacker News 是谈技术的网站。 它有 123 points 和 56 comments。 这表示很多人注意到了它。 这不表示它一定很快。
还要用很多电脑来试。 也要用很多 AI 模型来试。
💬 它想让电脑更快运行AI,但每台电脑可能不同
Magnitude会为不同电脑改变AI的计算方法。它很有想法,但还没有证明到处都最快。
- 这个工具会按照电脑调整AI。开发者说,新模型大约准备1分钟就能开始。
- 开发者说,它会少用一些记忆来读长故事,也会先猜后面的词。测试中没有明显忘记故事。以后它可能在家里的电脑和云端电脑之间切换,并按使用量收费。
- 测试读的是《白鲸》,最长64K个词。用户提醒,100K到200K的超长故事可能不一样。评论中还没有说明它在多次使用工具的真实工作中是否更好。
- 用户自报称,llama.cpp在一台5070 Ti上快20%至30%,在一台M5 Max上约快两倍。还有用户说两张显卡没有被正确使用。开发者说现在还不能使用多张GPU。
这是评论数为56时的初期(修订1)。获取56条,并从整体抽取56条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 Magnitude旨在加速智能体推理,但实机结果仍取决于硬件
Magnitude面向长上下文的智能体工作负载,按实际设备调节推理内核。开发者的基准结果与用户自报结果并不完全一致,因此需要按模型、GPU和上下文长度重新测试。
这是评论数为56时的初期(修订1)。获取56条,并从整体抽取56条总结。内容属于HN用户自述,并非编辑部核实的事实。