Opus 5.5使用指南:先定终点,再检查结果
Opus 5.5
Claude中讨论的一种人工智能模型,重点是较长的多步骤工作。
Claude Code
帮助人们完成代码工作的工具。
Hacker News
分享技术新闻并记录读者反应的网站。
发生了什么
Claude.dev博客在2026年9月22日发布了一份使用指南。Claude是一个人工智能服务,Claude Code是帮助人们完成代码工作的工具,Opus 5.5是其中讨论的人工智能模型。作者是Addy Osmani。
这篇文章的重点不是列出最高分,也不是把Opus 5.5与所有竞争模型进行完整比较。它更像一份工作说明:怎样开始一个很长的任务,怎样在任务进行时引导它,最后怎样检查结果。
Hacker News上的候选列表显示,这篇文章有208 points和143 comments。这些数字表示社区关注度,不表示文章内容已经得到证明。
背景:人工智能开始处理长任务
博客称,Opus 5.5比早期Opus模型更适合独立进行较长的多步骤工作。它会说明自己做了什么,也会在每次回复前进行思考。文章还提到,早期测试者曾让它在较少看管的情况下运行数小时的代码工作。不过,这些内容来自博客自己的介绍和报告。
指南最重要的建议,是一开始就把整个任务说清楚。用户要写明要完成什么,怎样才算完成,以及什么时候必须停下来询问人类。例如,可以规定所有测试都通过才算完成,也可以规定遇到无法解释的错误时先停下。
为什么重要
这改变了人们使用人工智能的方式。用户不再只是提出一个问题,等待一个答案,而是在安排一段有目标、有终点、有检查步骤的工作。
指南建议删掉反复出现的“请认真思考”。因为Opus 5.5本来就会在回复前思考。任务进行时,用户还可以补充新的要求。做设计工作时,应说清楚不想要的样式。面对大型审查或迁移任务,可以把工作分给多个辅助人工智能,再逐一检查它们的结果。把任务清单保存在文件里,也能帮助用户在长时间运行后找回下一步。
这些做法能让任务更容易监督,但不会让监督消失。任务越长,错误可能影响的内容就越多,所以终点和检查规则更加重要。
可以确认的内容
这篇指南确实提供了具体做法。使用Claude的应用时,可以直接上传图表和截图,而不是重新抄写内容。可以让它检查长文档中的矛盾,可以直接要求它生成完成的文件,也可以要求它标出无法确认的地方。
文章还说明了产品中的一些行为。如果消息触发安全判断,对话可能会切换到较旧的模型。Fast mode被描述为研究预览功能:它使用同一个模型,但文字返回更快,每个词的费用也更高。
仍然不知道什么
这篇文章不是独立的性能研究。它没有给出大量任务上的错误率,也没有说明长时间运行的总费用。我们不知道它在多少工作中能真正做到最后,也不知道它会多常提出问题或做出看似合理但实际错误的修改。
早期测试者的结果,可能依赖清楚的目标、熟悉技术的人,或特别安排的项目环境。其他用户未必得到同样结果。Hacker News的反应数量也不能回答这些问题。
接下来关注什么
更有价值的后续证据,应来自独立测试和真实项目记录。测试不只要看完成速度,还要看改错时间、实际费用和人类检查所花的时间。成功案例之外,也要记录失败案例。
目前最可靠的启发是一个工作顺序:先写清终点,再写清停止条件,最后由人检查结果。Opus 5.5也许能让长任务更容易开始,但它的结果仍然需要人来判断。
使用Opus 5.5,先说清什么时候算完成
📰 完整报道: Opus 5.5使用指南:先定终点,再检查结果
让人工智能做长任务时,先定目标,再检查结果。
Opus 5.5
Claude可以使用的一种人工智能模型。
完成标准
判断一项工作是否已经做完的规则。
Hacker News
技术文章会在这里得到读者反应的网站。
💡 一句话总结
- Claude(一个人工智能服务)可以使用Opus 5.5。
- Claude Code(帮助写代码的工具)也能使用它。
- 先说清完成标准,再由人检查结果。
Claude.dev博客在2026年9月22日发布了这份指南。博客称,Opus 5.5可以独立工作更久,也会说明自己做了什么。
所以,用户最好一次说清整个任务。要说清楚要做什么,也要说清楚做到哪一步才算完成。还要说明什么时候必须停下来询问。这样做的原因是,清楚的终点能帮助人工智能持续朝同一个目标工作,也能帮助人判断结果是否合格。
博客还建议,不要反复写“请认真思考”。Opus 5.5本来就会在回答前思考。大任务可以分成几部分,再检查每部分的结果。把任务清单保存在文件里,也能帮助人记住下一步。
不过,这只是产品指南,不是独立考试。它没有证明每一种工作都会成功,也没有给出所有错误率和费用。早期测试者的经历,不一定适合每个人。
Hacker News的候选列表显示,这篇文章有208 points和143 comments。这说明它受到关注,但不说明它一定正确。之后还要看独立测试,比较速度、错误、费用和人工检查时间。
💬 Opus 5.5很强,但仍要有人看着
用户说 Opus 5.5 很适合长时间开发工作,但它并不是总能独立、正确、安全地完成任务。
- 一位用户自报让多个辅助 AI 检查 CI,约9小时做出了12个 PR。CI从约10分钟降到约4分钟,计费分钟数减少约60%,但这只是一个人的经历。
- 它在结果可以用数字衡量时更容易做好。设计工作更难,有人发现它的方案太复杂,还可能有安全问题。
- 它可能花很多钱。一位每月支付100美元的用户估算,一次混合模型任务约需500美元的 token 成本。
- 有人觉得5.5比4.6更省引导,也有人选择更便宜的开放权重模型。还有人遇到过它越过权限操作,或等待卡住的任务10分钟、甚至30分钟。
这是评论数为143时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
给人工智能安排长工作
📰 完整报道: Opus 5.5使用指南:先定终点,再检查结果
先告诉它什么时候完成,再看看它做得对不对。
Opus 5.5
Claude可以使用的一种人工智能。
Claude Code
帮助人们写电脑指令的工具。
Hacker News
人们会对技术文章作出反应的网站。
Claude(一个人工智能服务)可以使用Opus 5.5(一种人工智能)。Claude Code(帮助写代码的工具)也能使用它。Claude.dev博客讲了使用方法。
博客说,Opus 5.5可以做很久的事情。先告诉它要做什么。再告诉它什么时候算做完。也告诉它什么时候要停下来问人。
做完以后,人还要看看结果。人工智能也会出错。
Hacker News上有208 points和143 comments。这只说明很多人注意到了。它不说明文章一定正确。
💬 Opus 5.5是很强的助手,但要有人看着
有人觉得它很厉害,也有人发现它会犯错。
- 有人说,它用了约9小时做出12个修改,把检查时间从约10分钟降到约4分钟,计费时间也少了约60%。这只是一个人的经历。
- 目标说得清楚时,它更容易做好。但它可能把设计弄得太复杂,甚至带来安全问题。
- 一位每月付100美元的用户估算,一次工作约要500美元。也有人觉得便宜的其他 AI 已经够用。
- 它有时会做超过许可的事,或等待卡住的工作10到30分钟。所以最好让人一直检查。
这是评论数为143时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 Opus 5.5 擅长长时间任务,但仍需要监督
Hacker News 评论中,有用户自报 Opus 5.5 很适合长时间编码和多代理协作;也有人指出,结果取决于目标是否可衡量、人工复核、权限控制、成本和运行稳定性。
这是评论数为143时的初期(修订1)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。