AI竞争为何变得尴尬:一场关于缓存效率的争论
KV缓存
模型暂时保存前文线索的记忆区域。
token
模型处理文字时使用的小单位。
模型蒸馏
让一个模型学习另一个模型回答方式的方法。
发生了什么
文章《The AI Race Just Got Awkward》提出一个判断:人工智能的竞争,正在从“谁的模型更聪明”,转向“谁能更省计算资源”。文章的中心例子,是DeepSeek(中国的人工智能团队)公开的一组缓存优化方法。KV缓存是模型暂时保存前文线索的地方。长对话和长代码会让这块缓存变大,并占用GPU显存。
文章称,DeepSeek-V4.1-Flash把缓存压到每个token 890字节。它提到CSA2、跨层复用、因果编码器—解码器结构和FP4缓存。文章把DeepSeek-V1处理100万个token时的389.12GB,与V4.1-Flash的890MB相比。389.12GB约等于0.89GB,389.12除以0.89约等于437,所以文章说新缓存约为原来的四百三十七分之一。这些是原文给出的技术说法,不是独立测试结论。
为什么这让竞争显得尴尬
作者把这件事放进模型蒸馏的争论中。Anthropic(Claude的开发公司)曾被文章描述为指责中国团队蒸馏自己的模型。模型蒸馏,是让一个模型学习另一个模型回答方式的方法。作者认为,新的变化不主要是模仿回答,而是采用公开的省资源方法。DeepSeek公开了相关思路,于是作者把西方公司的做法称为借鉴,而不是单纯的复制。
这仍然是作者的解释。文章没有证明Anthropic,或OpenAI(ChatGPT的开发公司),使用了完全相同的实现。
为什么缓存大小重要
长上下文系统会反复使用前面的内容。缓存越小,每个会话需要的显存可能越少。服务商就可能在同一批硬件上支撑更多长会话,也可能降低一部分运行成本。对编程工具来说,这关系到能否长时间保留一个项目的上下文。不过,缓存压缩是否影响速度、回答质量和稳定性,文章没有给出测试。
价格比较说明了什么
文章比较了缓存读取价格。它称,Claude Opus 5.5的价格从Claude Opus 5每百万token 0.50美元降到0.20美元,下降60%。它还称,GPT-6.1 Sol从GPT-5.6 Sol的0.50美元降到0.10美元,下降80%。作者把这些变化看成DeepSeek方法影响西方模型的证据。
但价格会受到很多因素影响。产品定位、供应成本和商业策略都可能改变价格。因此,价格变化本身不能证明某家公司采用了哪种技术。
目前能确认什么
能确认的是,原文给出了缓存容量、价格和一套行业判断。文章在Hacker News上获得178 points和104 comments。这个数字表示社区关注度,不表示技术说法已经正确。读者需要把“受到讨论”和“得到验证”分开。
还不知道什么
我们还不知道这些容量数字是在什么测量条件下得到的。也不知道Claude Opus 5.5和GPT-6.1 Sol是否真的运行了文中所说的机制。价格下降是否由缓存优化直接造成,也没有被证明。作者所说的“中国团队帮助了亏损的西方公司”,属于评论,不是已经确认的行业结论。
接下来应该看什么
下一步要看DeepSeek的技术论文、官方说明和可重复的测试。测试应同时比较显存占用、速度、回答质量和稳定性。官方模型资料也能帮助确认Anthropic与OpenAI实际采用了什么。这个话题的重要性,在于它提醒我们:AI竞争不只有模型分数,也包括让长工作更便宜、更稳定地运行。
AI为什么开始比赛谁更省记忆?
📰 完整报道: AI竞争为何变得尴尬:一场关于缓存效率的争论
中国AI团队DeepSeek(做人工智能的团队)介绍了一种缩小AI缓存的方法。相关[文章](https://insufferable.dev/posts/the-ai-race-just-got-awkward)在Hacker News(分享科技消息的网站)上受到关注。
KV缓存
AI暂时保存前文线索的地方。
DeepSeek-V4.1-Flash
文章提到的一个AI模型。
Hacker News
分享和讨论科技消息的网站。
💡 一句话总结
- 长对话需要临时记忆。
- DeepSeek称,它能把这块记忆变小。
- Hacker News的热度不等于内容正确。
AI会暂时记住前面说过的话。这个地方叫KV缓存。长对话或长代码越长,缓存就越大。它需要放进GPU显存。显存就是AI机器暂时放数据的记忆。
文章说,DeepSeek-V4.1-Flash这个AI模型使用约890MB。旧的DeepSeek-V1使用389.12GB。GB和MB都是计算机容量单位。389.12GB约等于0.89GB。389.12除以0.89约等于437。因此文章说,新缓存约为原来的437分之一。这个数字来自文章,不能单独说明速度和回答质量。
如果缓存变小,一台机器可能同时服务更多长会话。长时间写代码也可能更便宜。可是,压缩方法可能带来别的影响。文章没有测量速度、质量和稳定性。
文章还比较了两家公司的价格。Anthropic(Claude的开发公司)的Claude Opus 5.5,缓存读取价格下降了60%。OpenAI(ChatGPT的开发公司)的GPT-6.1 Sol,类似价格下降了80%。作者认为,这说明西方公司借鉴了DeepSeek的方法。可是价格也会受成本和商业计划影响。价格下降不能证明具体技术被采用。
文章在Hacker News上有178 points和104 comments。这个数字只表示有人关注。它不是正确分数。下一步要看官方技术资料、价格说明和实际测试。
💬 用简单的话看懂AI竞争争论
大家争论的是:便宜的AI技术扩散,到底是正常分享还是搭便车,以及谁会从中受益。
- KV缓存会把长输入已经算过的部分保存起来,再次使用。文章猜测,DeepSeek的技术促成了OpenAI和Anthropic的降价与提速。评论者说,也可能是它们自己研发或独立发现的,所以不能仅凭这些变化证明复制。
- 模型蒸馏就是让小模型模仿强模型的回答。它比从头训练大型前沿模型便宜。有人认为这不公平或违反服务条款,也有人认为公开研究就应该被使用。学习公开的人类数据和模仿另一个AI的输出并不完全相同。
- 中国公司公开技术,可能是为了低价推广、追赶先发者、应对GPU和出口限制、吸引用户,或获得竞争优势和技术声望。公开也能帮助更多软件支持它,但中国公司并没有统一的做法。
- 推理变便宜,可能伤害OpenAI和Anthropic的收入故事,也可能带来更多用户和更高利润。评论中有超过95%和约80%两种互相矛盾的估计,计算口径也不同。
- 用户对Qwen 3.8 27B的体验并不一致:一人自报在5090上超过每秒170个token,另一人自报它在复杂单元测试中表现糟糕。个人体验不能决定谁赢。
这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
AI的记忆变小了?
📰 完整报道: AI竞争为何变得尴尬:一场关于缓存效率的争论
DeepSeek(中国的AI团队)介绍了一个让AI记忆变小的办法。这个[故事](https://insufferable.dev/posts/the-ai-race-just-got-awkward)很受关注。
DeepSeek
做AI的中国团队。
KV缓存
AI暂时放下前面话语的小记忆。
Hacker News
人们分享科技消息的网站。
AI要记住刚才说过的话。 这样它才能继续长长的对话。 这种小记忆叫KV缓存。 它像AI放小纸条的地方。
旧记忆是389.12GB。 新记忆约是890MB。 GB和MB是电脑数大小的词。 890MB约是0.89GB。 389.12除以0.89约等于437。 新记忆约是原来的437分之一。
记忆变小后,AI可能更容易做长工作。 它也可能少花一些钱。 但我们还不知道答案是不是一样好。
文章还说,Anthropic(做Claude的公司)的一个价格降了60%。 OpenAI(做ChatGPT的公司)的一个价格降了80%。 写文章的人认为,这可能和DeepSeek的方法有关。 但价格变低,也可能有别的原因。
文章在Hacker News(分享科技消息的网站)上有178 points和104 comments。 这里的数字只表示很多人看到了它。 它不表示文章一定正确。
💬 给五岁孩子讲AI竞争
大家在争论,怎样让AI更便宜,以及谁应该得到功劳。
- 小AI可以看大AI的答案,然后学着做相似的答案。这叫蒸馏,通常更便宜。有人觉得这样不公平,也有人觉得分享研究很正常。
- 中国公司公开方法,可能是为了便宜地推广、追赶别人、吸引用户、互相竞争,或让大家看到自己的技术。不同公司想法不同。公开方法也会让更多程序学会使用它。
- 文章说,DeepSeek的KV缓存方法可能帮助美国公司降价和提速。但评论者说,美国公司也可能自己想到了类似方法,所以证据还不够。大家对赚多少钱也有不同看法,有人说超过95%,有人说约80%。
- 有人说Qwen 3.8 27B在5090上每秒能说出170多个小小的文字块。另一个人说它做难题时卡住了。这只是两个人的经历,所以还不能说谁赢了。
这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 AI竞争:是蒸馏、开放研究,还是更便宜的推理?
评论区围绕文章的核心推断分成两派:有人认为证据不足,把价格变化解释成直接复制过于武断;也有人认为蒸馏、开放权重和低成本推理确实正在改变竞争结构。
这是评论数为104时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。