🔥 HN 热议

Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Claude Opus 5.5

Anthropic发布的、面向复杂长任务的人工智能模型。

文本单位

计算模型输入和输出文字时使用的小单位,也用于计费。

基准测试

用相同任务比较不同模型能力的测试。

发生了什么

Anthropic(开发Claude的人工智能公司)在2026年9月22日发布Claude Opus 5.5。它是Claude 5.5系列的第一个模型。官方把它定位为处理长任务的工具,重点包括编程、电脑操作、资料研究和业务流程。公司说,用户现在可以通过Claude Platform、Amazon Web Services、Google Cloud和Microsoft Azure使用它。Anthropic官方发布

这则消息也在Hacker News引起关注。主要投稿有1,147个积分和784条评论。另一个投稿有273个积分和2条评论。这些数字表示社区的关注程度,不表示模型一定更强,也不表示官方说法一定正确。主要Hacker News投稿

背景:比较的不只是最高分

Anthropic把效率放在这次发布的中心位置。对于需要多次操作的人工智能,不能只看一次测试的最高分,还要看完成一项任务用了多少文本单位、多少步骤和多少钱。Anthropic也承认,在能力接近的模型之间,基准测试的差距不一定能准确表示真实差距。因此,这次发布的重点从谁得分最高,转向谁能用更少资源完成工作。

为什么重要

Claude Opus 5.5每100万个输入文本单位收费4美元,每100万个输出文本单位收费20美元。Opus 5的对应价格是5美元和25美元。缓存读取费用从每100万个单位0.50美元降到0.20美元。Anthropic说,普通任务的总成本大约下降40%,生成内容的速度提高30%以上。

一位早期测试者报告说,Claude Opus 5.5在不到3小时内检查并修复了一个包含20万行代码的代码库。使用Opus 5时,这项工作超过20小时,而且使用的文本单位是前者的2.5倍。这个例子来自Anthropic的发布材料。它说明了产品想要提供的优势,但不代表每个项目都会有相同结果。

已能确认的内容

从官方表格可以看到,Claude Opus 5.5在Terminal-Bench 4.0上的成绩为66.4%,Opus 5为52.3%,GPT-6 Astra为57.9%。不过,测试设置并不完全相同。Opus 5.5使用更高强度的设置,GPT-6 Astra使用另一种强度设置。Anthropic还说明,安全规则介入时,部分任务会由其他模型完成。因此,这些数字更适合看作有条件的比较,而不是永远有效的总排名。

安全方面,Anthropic说Claude Opus 5.5在自己的自动行为审查中取得了目前最好的结果。公司还说,它更少采取难以撤回的行动,也更能抵抗误导性指令。生物学和网络安全相关工作会受到额外限制。这些保护措施很重要,但也可能改变测试成绩。

仍不清楚

目前的主要证据来自Anthropic自己的测试和早期测试者。公司自己也提醒,接近的测试分数不一定代表真实使用中的差距。实际费用会受到任务长度、设置、缓存、工具和模型切换的影响。我们还需要更广泛的独立测试,也需要观察它在真实工作中长时间运行时的错误率和稳定性。

接下来观察

Anthropic表示,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周推出。接下来要看的不是它能否在一张榜单上领先,而是团队能否让它可靠地完成长任务,同时控制花费。独立评测和真实使用,才能说明Claude Opus 5.5会把人工智能带到哪里。

💬 Claude Opus 5.5:官方称更自然,但实际评价分歧明显

Anthropic将Claude Opus 5.5介绍为表达更自然、更清晰,并在代理式编程、电脑操作和知识工作方面表现强劲。但HN评论对实际体验、基准测试价值和发布页体验看法不一;性能与故障说法都应视为用户自述,而不是受控测试结论。

  • 文章的主张是,Opus 5.5比旧模型更自然、更容易理解。
  • 部分评论者自述Opus 5过于冗长或不自然;另一位早期试用者自述,5.5仍保留类似的节奏,重要内容会被埋在过多文字中。
  • 文章还提醒,在这种能力水平上,基准分数差距不一定可靠地代表真实使用差距;Opus 5.5与Fable 5.1的实际差距可能小于分数显示的差距。
  • 有评论推测,基准测试难以覆盖旧代码、技术债、可维护性、过度设计,以及含糊或互相矛盾的需求。该评论者也承认这只是推测,并非检查基准后的结论。
  • 用户自述批评发布页的滚动控制首屏很烦人,甚至接管了滚动操作;另一条用户自述称,打开Reduce Motion后会显示更简单的版本。
  • 关于有意放慢AI最前沿进展的说法,评论分成两种解释:一种认为这是给社会适应时间的安全措施;另一种认为这是可能有利于大公司影响监管的模糊宣传。这些只是评论中的不同看法,不是已证实的事实。

这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Claude Opus 5.5想让长工作更便宜

📰 完整报道: Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本

Anthropic说,新Claude更快,也能让长任务少花钱。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Claude Opus 5.5

Anthropic发布的、帮助人完成工作的人工智能。

文本单位

计算文字数量和模型费用时使用的小单位。

Hacker News

讨论技术新闻和话题的网站。

💡 一句话总结

  • Anthropic(开发Claude的人工智能公司)发布了Claude Opus 5.5。
  • 公司说它更快,也能让长工作少花钱。
  • Hacker News很关注它,但关注不等于正确。

Claude Opus 5.5是Claude 5.5系列的第一个模型。它可以帮助人写代码、操作电脑和查资料。Anthropic说,普通任务的费用大约少40%。它生成回答的速度快30%以上。

人工智能会把文字分成小单位来计算。这些单位叫文本单位。新模型每100万个输入文本单位收4美元。每100万个输出文本单位收20美元。前一个Opus 5的价格是5美元和25美元。这样一来,任务越长,节省的钱可能越明显。

公司还讲了一个测试例子。一位先行测试者处理了20万行代码。Opus 5.5用时不到3小时。Opus 5用时超过20小时。这个例子来自公司发布的材料。它不代表每个人都会得到同样结果。

Hacker News的主要投稿有1,147个积分和784条评论。它说明很多技术读者注意到了消息。它不是模型正确率的分数。Anthropic还说安全测试结果更好。接下来要看独立测试,以及真实工作中的稳定性和花费。

💬 Claude Opus 5.5:有人期待,也有人怀疑

Anthropic说Opus 5.5说话更清楚,也擅长编程、操作电脑和知识工作。但HN用户的个人体验并不一致。

  • 一些用户自述Opus 5以前太啰嗦、不自然;一位早期试用者说5.5仍然会用很多话,把重点藏起来。
  • 文章说,基准分数不一定等于日常工作表现。有人猜测,旧而复杂的代码、维护工作和不清楚的要求很难用普通测试衡量。
  • 一些用户自述发布页的强制滚动很烦;也有人报告打开Reduce Motion后页面更简单。
  • 关于放慢AI前沿进展,有人理解为为了安全,也有人认为这是可能让大公司更有利于影响监管的含糊说法。这些都是观点。

这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Claude Opus 5.5:会帮忙做长工作的电脑小帮手

📰 完整报道: Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本

Anthropic说,新Claude能用更少的钱做长工作。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Claude Opus 5.5

Anthropic做的新电脑帮手。

Hacker News

人们讨论技术消息的网站。

Anthropic(做Claude的公司)发布了Claude Opus 5.5。 它是一种会读话、会写话的电脑帮手。 它也会写电脑指令。 公司说,平常的工作少花约40%的钱。 写出回答的速度快30%以上。 所以,人们可能更愿意让它做长工作。

Hacker News是聊技术消息的网站。 主要投稿有1,147个积分和784条评论。 这些数字说明很多人看到了它。 它们不说明它一定正确。

公司做了安全测试。 但公司自己的测试不是全部答案。 真实工作里的表现,还要继续观察。

💬 Opus 5.5真的更好懂吗?

公司说Claude Opus 5.5会说得更清楚。但试过的人有不同感觉。

  • 有人自述旧模型话太多,也有人说5.5还是把重要内容藏在很多话里。
  • 测试分数高,不一定代表它能做好又大又乱的真实工作。
  • 有人不喜欢发布页一直让人滚动;打开Reduce Motion后据说更容易看。大家也在争论,放慢AI是为了安全,还是为了公司的利益和监管。

这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源