模型与评估 / 机制解读

Claude Sonnet 5.5:价格表只是起点,迁移真正要改的是请求与验收

Anthropic 对 Sonnet 5.5 的定位是面向边界明确的日常任务、修复 bug 和文档制作;官方同时承认,复杂且开放、需要持续判断的工作仍是 Opus 5.5 更强。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.c...

主题机制示意图,非产品截图或实测数据
机制示意 · 非实测数据

Claude Sonnet 5.5:价格表只是起点,迁移真正要改的是请求与验收

Anthropic 对 Sonnet 5.5 的定位是面向边界明确的日常任务、修复 bug 和文档制作;官方同时承认,复杂且开放、需要持续判断的工作仍是 Opus 5.5 更强。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 因而“接近旗舰”应附带任务和 effort 条件,而不是被翻译成所有编码能力全面打平。

同价升级,为何任务账单仍会变化

发布页列出的每百万 token 价格如下,都是官方标价,不是本次测试的实际账单。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5)

| 类别 | Sonnet 5.5 | Opus 5.5 |
|---|---:|---:|
| 输入 | $2 | $4 |
| 输出 | $10 | $20 |
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5 |

Sonnet 5.5 与 Sonnet 5 的单价相同;官方称新模型通常使用更少 token,并在其测试中每任务成本最多低 30%。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 这里有三种比较不能混用:新旧 Sonnet 的单价、Sonnet 与 Opus 的单价、完成任务所消耗的总量。尤其缓存读取价格相同,不能把整张账单概括为“旗舰的一半”。

官方还指出,Claude Code 与应用默认 Medium effort,Claude Platform 默认 High;更高 effort 可能增加检查与推理工作。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 我们的分析:同一模型在两个入口表现不同,不一定是模型被降级,也可能是默认设置不同。评估迁移时应固定模型 ID、effort、工具和验收任务,并记录缓存命中、推理和文本输出,而不是只看界面体感。

基准分数中的任务边界

官方列出 Terminal-Bench 4.0、FrontierCode、CursorBench 等不同指标。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 这些名称背后是不同目标:终端完成任务、修改能否被合并、真实编码场景表现,不适合抽出最好的一项就覆盖全部工程质量。

更有价值的是发布页的失败解释:Sonnet 5.5 在 FrontierCode 的 Max effort 得分低于 Xhigh;官方将部分失败归因于额外代码审查导致超时或修改超出任务范围。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 我们的分析:更多工作不一定是更好的工作。对“只修一个回归”的任务,顺手重构其他模块可能触犯验收条件。团队应把改动范围也纳入评测,而不是只奖励测试通过。

迁移硬改动:不是只换模型字符串

官方迁移文档给出模型 ID `claude-sonnet-5-5`,并区分 Messages API 与 Managed Agents:后者按文档只需更新模型名,前者需要检查参数与响应处理。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) 不应把某一个入口的简单迁移推广到所有 SDK 和平台。

从 Sonnet 5 的无前置思考模式迁移时,`thinking: {"type": "disabled"}` 会返回 400;应改为 `thinking: {"type": "between_tools"}`。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) `between_tools` 接受 low、medium、high effort,不接受 xhigh 或 max,也不能附带 `display`、`budget_tokens`、`block_binding`。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) 这类协议错误不是提示词不够好,继续重试同样请求并不能修复。

响应读取也必须按块类型处理,不能假设首个 content 块的 text 字段总是正文;工具循环应原样传回 thinking 块,包括空块,`max_tokens` 则同时覆盖 thinking 与文本。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) 这解释了为什么旧代码可能在请求成功后仍然丢内容,或者把省略显示的思考误当成“没有发生推理”。

官方还要求检查强制工具选择、追加式会话、computer use 接口和拒绝/回退处理;起始模型更旧时还有额外参数变更。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) 本文不是完整兼容性清单,升级前应按原文找到自己的起始模型,而不是套用其他代际的配置。

提示词与安全:减少仪式,不减少责任

发布页介绍了网络安全相关请求的防护与回退,也明确承认评估不能抓住每一种失败。[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) 因而迁移后遇到回退、拒绝或不同的工具行为,需要分别记录,不能统统当成质量下降,更不能声称新模型“杜绝幻觉”。

我们的分析:提示词可以移除过时的重复步骤,但任务要求、权限限制和验收条件不能一并删除。对代码任务,应该用项目测试和改动边界验证;对报表任务,检查原始表格中的数字与引用。模型写得自然,不等于数据已被复核。

一条可审计的升级路线|我们的分析

先复制一组现有真实任务,包含正常、缺数据、工具报错和拒绝场景;保存旧模型的输入、响应和最终产物,再在隔离分支中调整参数与解析逻辑。之后比较正确完成率、返工原因和每个合格任务总成本。只有通过这些检查,再扩大流量,并保留回退开关。

官方技能入口是 `/claude-api migrate this project to claude-sonnet-5-5`,它会先确认修改范围,最后给出人工核对清单。[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) 本次只核对文档,没有运行升级或产生性能测试。旧稿的“重试率下降 68%”“延迟恰为旗舰一半”没有对应证据,已删除;有证据的价格也必须保留类别与条件。

Sources

[[4] Introducing Claude Sonnet 5.5 \ Anthropic](https://www.anthropic.com/claude-sonnet-5-5) https://www.anthropic.com/claude-sonnet-5-5 — Introducing Claude Sonnet 5.5 \ Anthropic
[[5] Migrating to Claude Sonnet 5.5](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide) https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide — Migrating to Claude Sonnet 5.5

文章讨论

No comments yet