Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本
Claude Opus 5.5
Anthropic发布的、面向复杂长任务的人工智能模型。
文本单位
计算模型输入和输出文字时使用的小单位,也用于计费。
基准测试
用相同任务比较不同模型能力的测试。
发生了什么
Anthropic(开发Claude的人工智能公司)在2026年9月22日发布Claude Opus 5.5。它是Claude 5.5系列的第一个模型。官方把它定位为处理长任务的工具,重点包括编程、电脑操作、资料研究和业务流程。公司说,用户现在可以通过Claude Platform、Amazon Web Services、Google Cloud和Microsoft Azure使用它。Anthropic官方发布
这则消息也在Hacker News引起关注。主要投稿有1,147个积分和784条评论。另一个投稿有273个积分和2条评论。这些数字表示社区的关注程度,不表示模型一定更强,也不表示官方说法一定正确。主要Hacker News投稿
背景:比较的不只是最高分
Anthropic把效率放在这次发布的中心位置。对于需要多次操作的人工智能,不能只看一次测试的最高分,还要看完成一项任务用了多少文本单位、多少步骤和多少钱。Anthropic也承认,在能力接近的模型之间,基准测试的差距不一定能准确表示真实差距。因此,这次发布的重点从谁得分最高,转向谁能用更少资源完成工作。
为什么重要
Claude Opus 5.5每100万个输入文本单位收费4美元,每100万个输出文本单位收费20美元。Opus 5的对应价格是5美元和25美元。缓存读取费用从每100万个单位0.50美元降到0.20美元。Anthropic说,普通任务的总成本大约下降40%,生成内容的速度提高30%以上。
一位早期测试者报告说,Claude Opus 5.5在不到3小时内检查并修复了一个包含20万行代码的代码库。使用Opus 5时,这项工作超过20小时,而且使用的文本单位是前者的2.5倍。这个例子来自Anthropic的发布材料。它说明了产品想要提供的优势,但不代表每个项目都会有相同结果。
已能确认的内容
从官方表格可以看到,Claude Opus 5.5在Terminal-Bench 4.0上的成绩为66.4%,Opus 5为52.3%,GPT-6 Astra为57.9%。不过,测试设置并不完全相同。Opus 5.5使用更高强度的设置,GPT-6 Astra使用另一种强度设置。Anthropic还说明,安全规则介入时,部分任务会由其他模型完成。因此,这些数字更适合看作有条件的比较,而不是永远有效的总排名。
安全方面,Anthropic说Claude Opus 5.5在自己的自动行为审查中取得了目前最好的结果。公司还说,它更少采取难以撤回的行动,也更能抵抗误导性指令。生物学和网络安全相关工作会受到额外限制。这些保护措施很重要,但也可能改变测试成绩。
仍不清楚
目前的主要证据来自Anthropic自己的测试和早期测试者。公司自己也提醒,接近的测试分数不一定代表真实使用中的差距。实际费用会受到任务长度、设置、缓存、工具和模型切换的影响。我们还需要更广泛的独立测试,也需要观察它在真实工作中长时间运行时的错误率和稳定性。
接下来观察
Anthropic表示,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周推出。接下来要看的不是它能否在一张榜单上领先,而是团队能否让它可靠地完成长任务,同时控制花费。独立评测和真实使用,才能说明Claude Opus 5.5会把人工智能带到哪里。
Claude Opus 5.5想让长工作更便宜
📰 完整报道: Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本
Anthropic说,新Claude更快,也能让长任务少花钱。
Claude Opus 5.5
Anthropic发布的、帮助人完成工作的人工智能。
文本单位
计算文字数量和模型费用时使用的小单位。
Hacker News
讨论技术新闻和话题的网站。
💡 一句话总结
- Anthropic(开发Claude的人工智能公司)发布了Claude Opus 5.5。
- 公司说它更快,也能让长工作少花钱。
- Hacker News很关注它,但关注不等于正确。
Claude Opus 5.5是Claude 5.5系列的第一个模型。它可以帮助人写代码、操作电脑和查资料。Anthropic说,普通任务的费用大约少40%。它生成回答的速度快30%以上。
人工智能会把文字分成小单位来计算。这些单位叫文本单位。新模型每100万个输入文本单位收4美元。每100万个输出文本单位收20美元。前一个Opus 5的价格是5美元和25美元。这样一来,任务越长,节省的钱可能越明显。
公司还讲了一个测试例子。一位先行测试者处理了20万行代码。Opus 5.5用时不到3小时。Opus 5用时超过20小时。这个例子来自公司发布的材料。它不代表每个人都会得到同样结果。
Hacker News的主要投稿有1,147个积分和784条评论。它说明很多技术读者注意到了消息。它不是模型正确率的分数。Anthropic还说安全测试结果更好。接下来要看独立测试,以及真实工作中的稳定性和花费。
💬 Claude Opus 5.5:有人期待,也有人怀疑
Anthropic说Opus 5.5说话更清楚,也擅长编程、操作电脑和知识工作。但HN用户的个人体验并不一致。
- 一些用户自述Opus 5以前太啰嗦、不自然;一位早期试用者说5.5仍然会用很多话,把重点藏起来。
- 文章说,基准分数不一定等于日常工作表现。有人猜测,旧而复杂的代码、维护工作和不清楚的要求很难用普通测试衡量。
- 一些用户自述发布页的强制滚动很烦;也有人报告打开Reduce Motion后页面更简单。
- 关于放慢AI前沿进展,有人理解为为了安全,也有人认为这是可能让大公司更有利于影响监管的含糊说法。这些都是观点。
这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
Claude Opus 5.5:会帮忙做长工作的电脑小帮手
📰 完整报道: Claude Opus 5.5发布:高性能人工智能开始比拼每项工作的成本
Anthropic说,新Claude能用更少的钱做长工作。
Claude Opus 5.5
Anthropic做的新电脑帮手。
Hacker News
人们讨论技术消息的网站。
Anthropic(做Claude的公司)发布了Claude Opus 5.5。 它是一种会读话、会写话的电脑帮手。 它也会写电脑指令。 公司说,平常的工作少花约40%的钱。 写出回答的速度快30%以上。 所以,人们可能更愿意让它做长工作。
Hacker News是聊技术消息的网站。 主要投稿有1,147个积分和784条评论。 这些数字说明很多人看到了它。 它们不说明它一定正确。
公司做了安全测试。 但公司自己的测试不是全部答案。 真实工作里的表现,还要继续观察。
💬 Opus 5.5真的更好懂吗?
公司说Claude Opus 5.5会说得更清楚。但试过的人有不同感觉。
- 有人自述旧模型话太多,也有人说5.5还是把重要内容藏在很多话里。
- 测试分数高,不一定代表它能做好又大又乱的真实工作。
- 有人不喜欢发布页一直让人滚动;打开Reduce Motion后据说更容易看。大家也在争论,放慢AI是为了安全,还是为了公司的利益和监管。
这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 Claude Opus 5.5:官方称更自然,但实际评价分歧明显
Anthropic将Claude Opus 5.5介绍为表达更自然、更清晰,并在代理式编程、电脑操作和知识工作方面表现强劲。但HN评论对实际体验、基准测试价值和发布页体验看法不一;性能与故障说法都应视为用户自述,而不是受控测试结论。
这是评论数为1034时的成熟版(修订3)。获取500条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。