本文内容
Claude Opus 5.5 使用指南:适用场景、提示词与思考强度
当任务需要理解现有系统、完成相互关联的修改并验证结果时,Claude Opus 5.5 值得试用。先选择边界清楚的任务,从 medium 思考强度开始。提供相关代码或文档、明确的完成标准,以及能够证明成功的验证方法。只有能指出第一次尝试遗漏了什么,才提高强度,而不是因为菜单里还有更高档位。
本文讨论 Opus 5.5 有潜力的使用场景、如何编写任务说明,以及如何避免为看似出色却没有完成实际目标的工作付费。下面的流程是我们的建议,不是 Wavect 独立测试该模型后得出的性能结论。
为什么 Opus 5.5 最近受到关注?
Anthropic 于 2026 年 9 月 22 日发布 Opus 5.5,重点介绍了长时间任务、沟通表达和成本方面的改进。其“每项任务成本降低 40%”来自厂商与 Opus 5 的对比测量,并非所有用户都能获得的节省比例。查看 Anthropic 发布时提供的证据。
发布公告之外也有第一手积极反馈。Every 的提前体验团队认为编程与创意协作有所改善,但也遇到了交付未完成、额外工作过多的问题。这些观察能够解释部分热度,却不能代表开发者群体的普遍意见。阅读 Every 的体验记录与披露说明。
我们的理解是:吸引人的不只是回答质量,而是从模糊需求到可检查成果之间的阻力更小。开发者需要的是能够审查的代码修改,而不只是另一段关于“应该如何修改”的解释。
API 模型标识为 claude-opus-5-5,官方文档列出的上下文窗口为一百万 token。模型能够容纳多少上下文,与应用实际提供了哪些文件,是两回事。选择模型不会自动赋予它访问代码仓库或内部系统的权限。查看模型规格。
Opus 5.5 适合用来做什么?
**优先考虑需要跨文件、跨步骤或跨来源联系证据的工作。**Anthropic 的专用提示指南将仓库级编程、代码审查、知识工作和视觉输入列为相关优势。下表是我们建议的试点起点,不是经过测量的能力排名。查看 Opus 5.5 提示指南。
| 工作类型 | 任务说明 | 验收依据 |
|---|---|---|
| 现有代码重构 | 替换一项依赖或抽象,同时保持对外行为不变。 | 范围集中的差异、兼容性检查和回归测试结果。 |
| 故障调查 | 沿调用链追踪一次失败,并检验不同解释。 | 可复现案例、因果证据,以及修复前失败的测试。 |
| 前端实现 | 使用现有设计系统完成一条真实用户流程。 | 可运行的状态、渲染截图和交互检查。 |
| 研究综合 | 将确定的资料集整理成决策简报。 | 可追溯的事实、经过核验的计算和明确的未知项。 |
| 长时间交付 | 分检查点完成一组边界明确、相互关联的修改。 | 中间成果、预算记录和经过人工审核的结果。 |
每类任务都可以采用同样的说明结构:目标、输入、边界、证据和停止条件。这五项内容能让任务可审查,同时不必规定每一步实现方式。应当给予足够的解决问题空间,但不要让“什么才算完成”含糊不清。
如何让 Opus 5.5 重构代码,同时保持行为不变?
把“保持原有行为”写成必须交付的结果,而不是备注。迁移依赖前,先让它列出调用方和兼容性要求,再批准一个有代表性的改动切片。这个切片通过验证后,才能作为其余改动的模式。
Claude Code 的官方建议包括测试、构建和截图对比等可执行验证。阅读其验证工作流。
“把发票导出迁移到现有适配器后面,但不改变导出的行”是明确任务;“把账单系统现代化”则过于宽泛。前者有边界和可观察结果,后者容易引入与目标无关的架构决策。
将发票导出重构为使用项目现有的适配器。
先阅读仓库说明、适配器实现和导出测试。
修改前列出所有调用方,以及必须保持不变的行为。
保持公开接口、行排序、舍入和错误行为不变。
不要修改数据库结构、依赖版本或无关格式。
先实现一条代表性路径,再运行相关的现有测试。
现有覆盖不足以保护接口约定时,补充回归测试。
返回代码差异、实际运行的命令、结果和剩余风险。
如果保持行为需要修改对外约定,停止并请求批准。
不要合并或部署。
把参考输出保存在代理不可修改的位置。否则,代理可能同时修改实现和测试期望,两者虽然一致,却共同违反最初要求。可以让代理提出更新测试基准,但接受这项更新应当是独立决定。
Opus 5.5 怎样帮助排查故障和审查代码?
让它检验相互竞争的解释,而不是直接生成一个看起来合理的补丁。什么观察能够区分错误的状态转换与缺少重试?什么证据能区分授权失败与依赖服务不可用?最有价值的成果往往是一个失败测试,以及针对根因的小幅修复。
CodeRabbit 的 Standard 流水线发现了其生产模型组合遗漏的 11 个 OSS 问题,但也漏掉了该组合发现的 9 个,并报告了更高的 token 用量。Standard 是流水线配置,不是 API 思考档位。应测试互补覆盖,而不是假定替换后能发现所有问题。查看 CodeRabbit 的评估方法。
Sonar 在 544 项可执行 Java 任务中报告,Opus 5.5 High 的通过率为 87.7%,Opus 5 Thinking 为 88.6%。其更广泛分析还观察到生成代码量减少。这属于不同任务与设置,不能单独证实或推翻仓库级工作的改进。阅读 Sonar 原始评估。
调查为什么重复提交结账请求有时会创建第二个订单。
只使用提供的仓库、脱敏日志和合成测试数据。
不要联系生产服务,也不要修改真实订单。
梳理请求、状态转换和持久化路径。
给出两个合理原因,以及能够区分它们的证据。
修改实现前,先用本地测试复现证据支持的原因。
采用最小修复,并测试重复、并发和中断请求。
将已证实的问题与怀疑分开报告。
每个已证实的问题都应包含文件位置、复现步骤和影响。
不要把风格偏好放入缺陷列表。不要部署。
做审查试点时,让候选模型和现有审查器接收相同的冻结差异与上下文,在人工判定前保持两份结果独立。记录确认缺陷、误报和人工审查时间。评论更多,既不自动代表覆盖更好,也不自动代表表现更差。
如何获得真正可用的前端,而不只是漂亮样稿?
交给 Opus 5.5 一条完整但简短的用户旅程,例如查看发票、修正校验错误,再下载最终文档。指定必须复用的组件与设计变量。要求实现错误、空数据和加载状态,而不只是最适合展示的成功页面。
我们的 Claude Code 设计系统工作流区分已批准的视觉参考、实现规则和可复用示例。在让模型发明新视觉方向之前,先提供这些上下文。
使用现有设计系统实现发票详情流程。
先阅读已批准的参考、设计规则和最接近的现有组件。
保持当前路由、API 约定、字体和间距变量不变。
覆盖成功、加载、空数据、校验错误和服务器错误状态。
使用合成数据,不要虚构已经接通的后端集成。
在 390 px 和 1440 px 宽度检查实际渲染与键盘导航。
将截图与批准的参考对比,并修复非预期差异。
返回修改文件、交互检查结果和截图位置。
列出所有模拟或未经验证的部分。真实集成与验收检查
通过之前,不要声称流程已经可以投入生产。
这里的视口宽度只是验收条件示例,不是 Opus 官方推荐。请替换为产品真实需要覆盖的设备范围。如果代理无法使用浏览器,应明确说明,并保留“视觉验证待完成”的状态,而不是声称已经检查界面。
如何用 Opus 5.5 做研究和业务文档?
先要求来源记录,再要求润色后的建议。有效的来源记录会把每一条重要事实连接到来源、日期和具体位置。让它在形成流畅叙述之前,标出矛盾和缺失输入,避免这些问题被有说服力的文字掩盖。
例如,产品团队比较两种集成方案时,需要的是文档支持的限制、切换成本和未解决的假设,而不是用虚构评分掩盖证据空白。始终区分“来源说了什么”和“作者建议怎么做”。
根据提供的集成资料编写两页决策简报。
先交付简报,再考虑可选幻灯片或额外分析。
从待决定事项、约束和缺失输入开始。
只依据有证据支持的能力与明确假设比较方案。
每条重要事实都记录来源、日期以及页码或章节。
所有计算数字都展示公式和输入值。
无法获得的数值标为未知,不要悄悄估算。
最后提出下一项可逆实验及其验收标准。
不要联系供应商、发送消息或发布文档。
返回简报、来源记录和未解决的问题。
使用截图或密集图表时,尽可能同时提供原始数据,并要求区分读取值与计算值。需要品牌化交付物时,提供真实模板,禁止替换标识或编造品牌信息。审查最终文件,而不只是模型对文件的描述。
如何避免 Opus 5.5 的长会话偏离目标?
**给它交付顺序,而不是无限优化的许可。**我们建议三个检查点:在约定范围内调查,完成最小可运行结果,最后验证并移交。每个检查点都必须提供其他人能够检查的成果。
将稳定的仓库约定保存在工具支持的项目说明中。Claude Code 文档介绍了 CLAUDE.md 与自动记忆,但上下文管理不等于无限保存发生过的一切。查看 Claude Code 的记忆行为。
维护一份简短任务记录,包含当前 commit、已批准决策、待完成工作和验证结果。要求下一会话先核对仓库状态,再相信记录。我们的编程代理上下文指南讨论更广泛的信息问题;本文关注如何把新模型放进这个流程。
并行工作必须真正可以分离。例如,一个代理检查 API 兼容性,另一个执行现有测试,再由协调者对齐结果。不要在没有文件归属规则的情况下,让多个代理同时重写相同文件。增加代理数量不能替代清晰任务。
预算与权限约束应放在提示词之外。Claude Code 的成本文档介绍了使用量可见性和相关控制,但具体功能取决于执行环境。查看适用的成本控制。
我们的操作建议比“请不要超预算”更严格:使用能够停止后续调用的监督程序或产品限制,不提供生产凭证,并要求外部操作经过批准。写在提示词里的时间或金额上限是一项请求,不是安全边界。
Opus 5.5 的 medium 和 high 应该怎样选择?
**从 medium 开始,再针对明确失败测试更高档位。**Opus 5.5 支持 low、medium、high、xhigh 和 max,文档默认值为 medium。强度标签是模型特定的,相同名称并不意味着相同计算量。阅读 Anthropic 的思考强度文档。
| 档位 | 试验任务 | 调整依据 |
|---|---|---|
low | 简短、可逆且容易验证的编辑。 | 上下文充分,但仍遗漏必需细节。 |
medium | 边界清楚的功能、重构或基于来源的简报。 | 澄清说明之后,仍有实质错误。 |
high | 困难根因或相互影响的约束。 | 额外推理能以可接受成本解决已识别的问题。 |
xhigh / max | 少量特别困难的案例。 | 只有验收改善足以覆盖时间与费用时才保留。 |
提高强度之前,先检查真正缺少的是否是一段日志、一个数据结构、一份测试数据,或者读取文件的权限。更多推理不能凭空获得从未提供的私有事实。一次只改变一个变量;当两种配置都通过同样检查时,保留成本较低的配置。
如何在 Claude Code 中选择 Opus 5.5?
当前官方文档要求使用 Claude Code v2.1.280 或更高版本。检查已安装版本,按受支持的安装方式更新,并明确选择模型。供应商别名与组织限制可能影响可用选项。查看模型选择和强度配置。
claude --version
claude update
claude --model claude-opus-5-5 --effort medium
以上示例面向受支持的 Claude 直接连接设置。使用云提供商时,按要求填写其部署标识,不要把直接 API 标识复制到所有集成中。记录对比结果之前,检查会话标题和模型选择器。
在已有交互会话中,可使用 /model claude-opus-5-5 和 /effort medium。明确模型标识尤其适合试点,避免结果悄悄依赖某个别名当时指向什么。客户端版本与任何回退模型也应单独记录。
使用聊天应用或其他编辑器时,应通过该产品的模型选择器和可用控制项配置。这些终端命令适用于 Claude Code;下面的 API 参数不一定能直接粘贴进聊天界面。
API 用户采用 Opus 5.5 前需要修改什么?
迁移并不只是替换模型名称。关闭思考、手动设置思考预算和强制工具选择都会被拒绝。还需要保留思考块历史;Claude API 和 Google Cloud 上原来的电脑操作工具也发生变化。按照官方迁移清单检查。
进行小范围直接 API 检查时,将以下内容保存为 opus55-request.json。请求自带输入,不假装 API 能看到本地文件。这是根据文档编写的示例,不是为本文实际发出的请求。
{
"model": "claude-opus-5-5",
"max_tokens": 4096,
"thinking": { "type": "adaptive", "display": "summarized" },
"output_config": { "effort": "medium" },
"messages": [{
"role": "user",
"content": "审查这项拟议修改:重试会先创建新订单,然后才检查现有请求标识。解释风险并提出本地回归测试。不要声称已经检查过代码仓库。"
}]
}
配置 API 密钥并确保账户具备额度后,执行下列请求会产生 API 费用。不要将凭证粘贴到 JSON 文件或提交到版本控制。
curl --fail-with-body --silent --show-error \
https://api.anthropic.com/v1/messages \
-H "x-api-key: ${ANTHROPIC_API_KEY:?Set ANTHROPIC_API_KEY first}" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
--data-binary @opus55-request.json
一个容易忽略的问题是代理在工具调用之间看起来没有反馈。Opus 5.5 把这类说明放进默认省略的思考块;display: "summarized" 请求可读摘要。本例不是流式请求。摘要不等于完整审计记录,还应保留工具调用、结果与操作日志。查看响应结构变化。
需要机器可读输出时,应区分结构有效与任务完成。严格工具参数约束的是调用格式,不保证模型一定调用工具,也不保证内容符合事实。应用本身必须验证必要动作。阅读结构化输出的保证与限制。
Opus 5.5 每项任务实际花费多少?
以下为标准直接 API 价格,单位是每百万 token 的美元费用,核验日期为 2026 年 9 月 24 日。它们不是订阅价格,也不保证适用于其他提供商的账单。查看 Anthropic 当前价格表。
| 用量类别 | Opus 5.5 | Opus 5 |
|---|---|---|
| 未缓存输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
| 五分钟缓存写入 | $5 | $6.25 |
| 一小时缓存写入 | $8 | $10 |
假设一个虚构工作负载包含 200,000 个未缓存输入 token、100,000 个五分钟缓存写入 token、一百万个缓存读取 token,以及 20,000 个输出 token,则计算如下:
Opus 5.5:$0.80 + $0.50 + $0.20 + $0.40 = $1.90。
Opus 5:$1.00 + $0.625 + $0.50 + $0.50 = $2.625。
在各类 token 用量完全相同的条件下,费用约降低 27.6%,不是 40%。这是算术示例,不是性能测试。它没有计入工具、基础设施、额外尝试、价格调整或人工审查。两个模型的真实 token 用量可能不同,方向也不一定相同。
提示缓存复用符合要求的相同前缀,并不是永久项目记忆。把稳定说明和可复用上下文放在变化的任务细节之前,再检查实际报告的缓存用量,不要假定每次重复都会优惠。阅读缓存匹配与计费规则。
Fast mode 是另一种取舍:直接 API 预览版的输入与输出价格分别为每百万 token 8 美元和 40 美元。它面向输出速度,并不保证整个任务耗时按同样比例减少。只有等待确实是测得的瓶颈时,才值得专门试验。查看 Fast mode 的适用范围与价格。
采用决策应看每项通过验收任务的成本:所有尝试中的模型和工具费用,加上审查与返工成本,再除以验收通过的任务数。即使不把审查时间折算成金额,也应单独展示。没有通过验收的任务同样消耗预算。
哪些情况下不应该默认使用 Opus 5.5?
如果一个确定性转换已经有可靠脚本处理,常规任务已有更便宜的模型稳定完成,或者所需信息不能共享给已批准的服务,就不必默认使用 Opus 5.5。这是任务选择原则,不是在断言模型没有能力。
同样,不要把有说服力的回答当成权限、付款或破坏性修改的唯一发布关卡。先定义独立检查;无法检查结果时,降低任务权限,或者只让模型提供建议。
业务决定尚未解决时,不要要求代理一次构建整个产品。应先由人明确用户问题、范围和验收标准,再让代理在这些决定之内实现。升级模型不能替团队决定客户真正需要什么。
如何在自己的仓库中评估 Opus 5.5?
先进行小规模受控试点,再修改整个团队的默认模型。我们建议选取十项历史任务,涵盖重构、可复现故障、界面修改和一份来源明确的简报。使用已经完成且审查者能判断有效结果的任务,但不要把原始解决方案放进代理输入。
让 medium 档位的 Opus 5.5 和当前配置获得相同的冻结起点、工具、权限与任务说明。困难案例应重复运行,因为单次结果可能误导判断。只将失败案例有选择地提升到 high,不要把不同配置悄悄混成一个总结果。
| 记录项 | 作用 |
|---|---|
| Commit、模型、强度、客户端及回退模型 | 明确配置与起始状态。 |
| 验收与回归结果 | 区分真正完成与看似合理的输出。 |
| 全部尝试、token 分类及工具费用 | 避免一次便宜的成功重试掩盖之前的支出。 |
| 总耗时与人工审查分钟数 | 区分推理速度与实际交付速度。 |
| 意外编辑与外部动作 | 判断流程是否始终处于授权范围内。 |
选择能以适当总成本达到验收门槛的配置,并保留旧配置应对回归。最终组合可能是:Opus 5.5 处理较复杂工程,小模型处理常规工作,重要决定仍需人工批准。
Wavect 的 AI enablement 服务关注如何把工具访问转化为团队可重复执行的流程。Twinsoft AI 案例属于另一项实施经验,不是 Opus 5.5 基准测试,也不表示该项目部署了这个模型。可以参考上线前 QA 决策指南定义证据,或围绕实际仓库讨论代理工作流试点。
本文的来源、日期与局限
本文于 复核,距发布两天。我们核对了 Anthropic 文档以及上文链接的原始评估。这是一份基于来源的分析,包含建议提示词和评估标准,不是 Wavect 亲自运行的模型基准测试。本文没有执行真实 API 请求、生产迁移或延迟实验。
正式采用前,请重新核验可用性、价格和客户端要求。固定试点使用的配置,并在模型或客户端发生变化后重新执行验收任务。
Opus 5.5 使用常见问题
Claude Opus 5.5 最适合哪些任务?
Opus 5.5 应选 medium 还是 high?
Opus 5.5 一定比 Opus 5 便宜 40% 吗?
怎样在 Claude Code 中启用 Opus 5.5?
Opus 5.5 可以关闭思考吗?
为什么 Opus 5.5 在工具调用之间没有说明?
Opus 5.5 能取代人工代码审查吗?
一百万 token 上下文是否意味着持久记忆?
最终思考
把 Opus 5.5 用在需要联系信息并交付可检查成果的工作上。从 medium 开始,提供证据与边界,判断最终结果,而不是回答的自信程度。合适的配置应以合理总成本通过你的验收检查。
