🔥 HN 热议

AI竞争为何变得尴尬:一场关于缓存效率的争论

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
KV缓存

模型暂时保存前文线索的记忆区域。

token

模型处理文字时使用的小单位。

模型蒸馏

让一个模型学习另一个模型回答方式的方法。

发生了什么

文章《The AI Race Just Got Awkward》提出一个判断:人工智能的竞争,正在从“谁的模型更聪明”,转向“谁能更省计算资源”。文章的中心例子,是DeepSeek(中国的人工智能团队)公开的一组缓存优化方法。KV缓存是模型暂时保存前文线索的地方。长对话和长代码会让这块缓存变大,并占用GPU显存。

文章称,DeepSeek-V4.1-Flash把缓存压到每个token 890字节。它提到CSA2、跨层复用、因果编码器—解码器结构和FP4缓存。文章把DeepSeek-V1处理100万个token时的389.12GB,与V4.1-Flash的890MB相比。389.12GB约等于0.89GB,389.12除以0.89约等于437,所以文章说新缓存约为原来的四百三十七分之一。这些是原文给出的技术说法,不是独立测试结论。

为什么这让竞争显得尴尬

作者把这件事放进模型蒸馏的争论中。Anthropic(Claude的开发公司)曾被文章描述为指责中国团队蒸馏自己的模型。模型蒸馏,是让一个模型学习另一个模型回答方式的方法。作者认为,新的变化不主要是模仿回答,而是采用公开的省资源方法。DeepSeek公开了相关思路,于是作者把西方公司的做法称为借鉴,而不是单纯的复制。

这仍然是作者的解释。文章没有证明Anthropic,或OpenAI(ChatGPT的开发公司),使用了完全相同的实现。

为什么缓存大小重要

长上下文系统会反复使用前面的内容。缓存越小,每个会话需要的显存可能越少。服务商就可能在同一批硬件上支撑更多长会话,也可能降低一部分运行成本。对编程工具来说,这关系到能否长时间保留一个项目的上下文。不过,缓存压缩是否影响速度、回答质量和稳定性,文章没有给出测试。

价格比较说明了什么

文章比较了缓存读取价格。它称,Claude Opus 5.5的价格从Claude Opus 5每百万token 0.50美元降到0.20美元,下降60%。它还称,GPT-6.1 Sol从GPT-5.6 Sol的0.50美元降到0.10美元,下降80%。作者把这些变化看成DeepSeek方法影响西方模型的证据。

但价格会受到很多因素影响。产品定位、供应成本和商业策略都可能改变价格。因此,价格变化本身不能证明某家公司采用了哪种技术。

目前能确认什么

能确认的是,原文给出了缓存容量、价格和一套行业判断。文章在Hacker News上获得178 points和104 comments。这个数字表示社区关注度,不表示技术说法已经正确。读者需要把“受到讨论”和“得到验证”分开。

还不知道什么

我们还不知道这些容量数字是在什么测量条件下得到的。也不知道Claude Opus 5.5和GPT-6.1 Sol是否真的运行了文中所说的机制。价格下降是否由缓存优化直接造成,也没有被证明。作者所说的“中国团队帮助了亏损的西方公司”,属于评论,不是已经确认的行业结论。

接下来应该看什么

下一步要看DeepSeek的技术论文、官方说明和可重复的测试。测试应同时比较显存占用、速度、回答质量和稳定性。官方模型资料也能帮助确认Anthropic与OpenAI实际采用了什么。这个话题的重要性,在于它提醒我们:AI竞争不只有模型分数,也包括让长工作更便宜、更稳定地运行。

💬 AI竞争:是蒸馏、开放研究,还是更便宜的推理?

评论区围绕文章的核心推断分成两派:有人认为证据不足,把价格变化解释成直接复制过于武断;也有人认为蒸馏、开放权重和低成本推理确实正在改变竞争结构。

  • KV缓存的因果关系:文章把OpenAI和Anthropic降低缓存读取价格、提高推理速度,联系到DeepSeek公开的KV缓存优化。评论者指出,仅凭价格和速度,无法排除这些公司早已内部完成、独立发现,或组合了多种方法;目前没有直接复制的证据。
  • 蒸馏与公平性:模型蒸馏是让学生模型优化到能够复现教师模型输出的方法,通常比训练前沿模型便宜得多。批评者认为这绕开了昂贵的研发投入,甚至可能违反服务条款;支持者认为公开论文和实现本来就可以被使用,而且西方模型也建立在公开研究和人类数据之上。另一些人强调,利用公开数据学习与蒸馏另一个模型的行为并不是一回事。
  • 为什么公开:评论者提出了多种解释:把LLM商品化以削弱既有巨头,在GPU出口限制下优先追求效率,后发公司借此获得用户和分发渠道,以及争夺国内竞争优势、软实力或技术声望。这些只是评论区的假设,并非已经确认的单一动机。
  • 中国实验室并不是一个整体:中国公司有的公开研究或小模型,有的保留模型权重,有的按项目决定是否公开。由一个中央政策统一决定所有公司发布策略的说法,被认为过于简单。
  • 商业影响与生态:有评论认为,KV缓存优化需要推理端软件更新,因此公开它有助于建立生态,也很难完全保密。推理成本下降可能压低专有模型公司的增长叙事和价格,但也可能增加需求、使用量或利润率;企业客户仍可能为质量、安全和知识产权保障付费。评论中的估计互相冲突:一方引用Kimi K3分析,称利润率远高于95%;另一方引用Anthropic在非标准调整后EBITDA口径下约80%的说法,因此经济影响尚无定论。
  • 本地性能是用户自报:一名用户称Qwen 3.8 27B在5090上运行了两周多,速度超过每秒170个token,并认为它接近九个月前的前沿模型。另一名用户称它在复杂单元测试中耗尽上下文,迟迟没有写出代码。这些都是个人经历,不是受控基准测试。
  • 结论:评论区同时存在正常研究分享、商业知识产权与合同纠纷,以及反对把事情描述成美中军备竞赛的观点。文章关于直接复制的解释仍是有趣的假设,不是已证实的事实;HN的排名和讨论热度也不能证明它正确。

这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

AI为什么开始比赛谁更省记忆?

📰 完整报道: AI竞争为何变得尴尬:一场关于缓存效率的争论

中国AI团队DeepSeek(做人工智能的团队)介绍了一种缩小AI缓存的方法。相关[文章](https://insufferable.dev/posts/the-ai-race-just-got-awkward)在Hacker News(分享科技消息的网站)上受到关注。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
KV缓存

AI暂时保存前文线索的地方。

DeepSeek-V4.1-Flash

文章提到的一个AI模型。

Hacker News

分享和讨论科技消息的网站。

💡 一句话总结

  • 长对话需要临时记忆。
  • DeepSeek称,它能把这块记忆变小。
  • Hacker News的热度不等于内容正确。

AI会暂时记住前面说过的话。这个地方叫KV缓存。长对话或长代码越长,缓存就越大。它需要放进GPU显存。显存就是AI机器暂时放数据的记忆。

文章说,DeepSeek-V4.1-Flash这个AI模型使用约890MB。旧的DeepSeek-V1使用389.12GB。GB和MB都是计算机容量单位。389.12GB约等于0.89GB。389.12除以0.89约等于437。因此文章说,新缓存约为原来的437分之一。这个数字来自文章,不能单独说明速度和回答质量。

如果缓存变小,一台机器可能同时服务更多长会话。长时间写代码也可能更便宜。可是,压缩方法可能带来别的影响。文章没有测量速度、质量和稳定性。

文章还比较了两家公司的价格。Anthropic(Claude的开发公司)的Claude Opus 5.5,缓存读取价格下降了60%。OpenAI(ChatGPT的开发公司)的GPT-6.1 Sol,类似价格下降了80%。作者认为,这说明西方公司借鉴了DeepSeek的方法。可是价格也会受成本和商业计划影响。价格下降不能证明具体技术被采用。

文章在Hacker News上有178 points和104 comments。这个数字只表示有人关注。它不是正确分数。下一步要看官方技术资料、价格说明和实际测试。

💬 用简单的话看懂AI竞争争论

大家争论的是:便宜的AI技术扩散,到底是正常分享还是搭便车,以及谁会从中受益。

  • KV缓存会把长输入已经算过的部分保存起来,再次使用。文章猜测,DeepSeek的技术促成了OpenAI和Anthropic的降价与提速。评论者说,也可能是它们自己研发或独立发现的,所以不能仅凭这些变化证明复制。
  • 模型蒸馏就是让小模型模仿强模型的回答。它比从头训练大型前沿模型便宜。有人认为这不公平或违反服务条款,也有人认为公开研究就应该被使用。学习公开的人类数据和模仿另一个AI的输出并不完全相同。
  • 中国公司公开技术,可能是为了低价推广、追赶先发者、应对GPU和出口限制、吸引用户,或获得竞争优势和技术声望。公开也能帮助更多软件支持它,但中国公司并没有统一的做法。
  • 推理变便宜,可能伤害OpenAI和Anthropic的收入故事,也可能带来更多用户和更高利润。评论中有超过95%和约80%两种互相矛盾的估计,计算口径也不同。
  • 用户对Qwen 3.8 27B的体验并不一致:一人自报在5090上超过每秒170个token,另一人自报它在复杂单元测试中表现糟糕。个人体验不能决定谁赢。

这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

AI的记忆变小了?

📰 完整报道: AI竞争为何变得尴尬:一场关于缓存效率的争论

DeepSeek(中国的AI团队)介绍了一个让AI记忆变小的办法。这个[故事](https://insufferable.dev/posts/the-ai-race-just-got-awkward)很受关注。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
DeepSeek

做AI的中国团队。

KV缓存

AI暂时放下前面话语的小记忆。

Hacker News

人们分享科技消息的网站。

AI要记住刚才说过的话。 这样它才能继续长长的对话。 这种小记忆叫KV缓存。 它像AI放小纸条的地方。

旧记忆是389.12GB。 新记忆约是890MB。 GB和MB是电脑数大小的词。 890MB约是0.89GB。 389.12除以0.89约等于437。 新记忆约是原来的437分之一。

记忆变小后,AI可能更容易做长工作。 它也可能少花一些钱。 但我们还不知道答案是不是一样好。

文章还说,Anthropic(做Claude的公司)的一个价格降了60%。 OpenAI(做ChatGPT的公司)的一个价格降了80%。 写文章的人认为,这可能和DeepSeek的方法有关。 但价格变低,也可能有别的原因。

文章在Hacker News(分享科技消息的网站)上有178 points和104 comments。 这里的数字只表示很多人看到了它。 它不表示文章一定正确。

💬 给五岁孩子讲AI竞争

大家在争论,怎样让AI更便宜,以及谁应该得到功劳。

  • 小AI可以看大AI的答案,然后学着做相似的答案。这叫蒸馏,通常更便宜。有人觉得这样不公平,也有人觉得分享研究很正常。
  • 中国公司公开方法,可能是为了便宜地推广、追赶别人、吸引用户、互相竞争,或让大家看到自己的技术。不同公司想法不同。公开方法也会让更多程序学会使用它。
  • 文章说,DeepSeek的KV缓存方法可能帮助美国公司降价和提速。但评论者说,美国公司也可能自己想到了类似方法,所以证据还不够。大家对赚多少钱也有不同看法,有人说超过95%,有人说约80%。
  • 有人说Qwen 3.8 27B在5090上每秒能说出170多个小小的文字块。另一个人说它做难题时卡住了。这只是两个人的经历,所以还不能说谁赢了。

这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源