Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30%
9 月 28 日 Anthropic 在 Opus 5.5 发布仅一周后推出 Claude Sonnet 5.5,作为 5.5 系列第二款模型。Sonnet 5.5 维持 $2/$10 的输入/输出价不变,但在 agentic coding 基准 Terminal-Bench 4.0 上取得 70.6%,比上一代 Sonnet 5 的 10.3% 高近 7 倍,并反超一周前发布的 Opus 5.5(66.4%)。Anthropic 同时把单任务综合成本最高降 30%、输出速度提升 30%+,并首次为 Sonnet 系列配上旗舰级网络安全防护机制。百器AI 未实测,所有基准为厂商口径,跨厂商对比数据来自官方同一张表。
核心结论
Anthropic 在 9 月 23 日与 9 月 28 日一周内连发 Opus 5.5 与 Sonnet 5.5;5.5 系列三档(Opus/Sonnet/Haiku)的产品分工正在固化,Haiku 5.5 即将补齐最后一段
Sonnet 5.5 价格不变($2/$10),但单任务综合成本最高降 30%——这是与 GPT-6 Sol/Luna 的"显性降价 + 任务计价"叙事不同的"隐性成本战":账单变小但合同价不动
Terminal-Bench 4.0 上 Sonnet 5.5(70.6%)首次反超一周前发布的 Opus 5.5(66.4%),是 Anthropic 自家表中罕见的 Sonnet 反超 Opus——但所有数字均为厂商口径,无第三方独立复现
FrontierCode 1.1 Max effort 下 Sonnet 5.5 反低于 Xhigh effort(46.2% vs 52.1%):智能体场景中"开最高算力档位"不必然带来更好结果,参数选择正在成为新变量
Sonnet 5.5 是 Sonnet 系列首个带旗舰级网络安全保障发布的型号:高风险请求会被主动重定向给 Sonnet 5 处理——这是 Sonnet 系列首次具备此能力
对选型者:把 Sonnet 5.5 视为 Opus 5.5 之下、Haiku 5.5 之上的中间档使用,而不是替换;大批量轻量任务的最终决策建议等 Haiku 5.5 在 10 月发布后再做
对比判断表
| 对比维度 | Claude Sonnet 5.5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| 定位 | 日常 agentic、文档、代码编辑、设计辅助 | 复杂推理与持续判断、长链路任务 | 编程等复杂工作负载 |
| 上下文 / 最大输出 | 未公开(同 Opus 5.5 推测 100 万 / 12.8 万 token) | 100 万 / 12.8 万 token | 105 万 / 12.8 万 token |
| 输入价(每百万) | $2 | $4 | $2 |
| 输出价(每百万) | $10 | $20 | $10 |
| 缓存读取 | $0.20(同 Sonnet 5) | $0.2(降 60%) | 官方称默认更高命中率 |
| Terminal-Bench 4.0(厂商口径) | 70.6% | 66.4% | 未公开报告 |
| FrontierCode 1.1 Main(厂商口径) | 52.1% Xhigh / 46.2% Max | 54.4% | 49.3% |
| CursorBench 4.0(厂商口径) | 55.5% | 57.8% | 未公开报告 |
| GDPval-AA v2.1(厂商口径) | 1844 | 1846 | 1487 |
| 单任务综合成本 | 比 Sonnet 5 最高降 30%(官方称) | 较 Opus 5 降 40%(官方称) | AutomationBench $0.27/任务(官方称) |
| 百器AI 实测 | 未实测 | 未实测 | 未实测 |
落地检查清单
发生了什么:9/28 Sonnet 5.5 上线,5.5 系列一周内连发两款
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5,距离 9/23 发布 Claude Opus 5.5 仅 5 天。这是 Claude 5.5 系列的第二款模型,按此前官方公告,Haiku 5.5 将在未来几周内加入,形成 Opus/Sonnet/Haiku 三档完整矩阵。
Sonnet 5.5 的官方定位是 Opus 5.5 的"更快、更低成本"补充:Opus 处理需要仔细判断的复杂工作,Sonnet 承担范围明确的日常任务——修 bug、写文档、PPT、电子表格,以及需要稳定结构化输出的设计场景。Anthropic 在 9/28 官方博客中明确写道:"Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets."
价格策略与 9/23 的"API 永久半价"叙事完全不同。Opus 5.5 发布时是直接降输入/输出价,OpenAI 紧接着 GPT-6 Sol/Luna 同步降价;Sonnet 5.5 选择不调单价,而是通过"更少 token、更少工具调用、更快生成"把单任务实际成本最高压低 30%。这是一种隐性的成本战,而不是显性的价格战。
更值得注意的是,Sonnet 5.5 同时被配上旗舰级网络安全防护:Anthropic 在 9/28 博客中确认,它是 Sonnet 系列首款发布时就启用与 Opus 5 / Fable 5.1 同等级 cyber safeguards 的型号。Anthropic 没有把这一升级放在产品主标题,但放在安全段落本身就是一种信号——能力上探到一定阈值后,安全边界必须同步上移。
关键变化一:Terminal-Bench 4.0 上反超 Opus 5.5,但厂商口径无第三方复现
在 Anthropic 主导的智能体编程评测 Terminal-Bench 4.0 上,Sonnet 5.5 取得 70.6%,上一代 Sonnet 5 仅 10.3%,而一周前发布的 Opus 5.5 是 66.4%。这是 Anthropic 自家基准表中首次出现 Sonnet 子型号反超 Opus 子型号的场景。
同一张表还披露了 Sonnet 5.5 在 8 个评测上的得分:CursorBench 4.0 真实编辑器场景 55.5%(Sonnet 5: 34.1%;Opus 5.5: 57.8%);FrontierCode 1.1 Main 46.2% Max / 52.1% Xhigh(Sonnet 5: 42.4%;Opus 5.5: 54.4%;GPT-6 Sol: 49.3%);GDPval-AA v2.1 44 种职业真实工作测试 1844 分(Sonnet 5: 1449;Opus 5.5: 1846;GPT-6 Sol: 1487)。
必须诚实标注的限制:以上所有分数均为 Anthropic 官方口径,没有第三方独立复现;GPT-6 Sol 在 Terminal-Bench 4.0 上未公开报告,所以 Sonnet 5.5 vs GPT-6 Sol 在该基准上的对比不成立;跨厂商对比只能在 Anthropic 与 OpenAI 都报告了的评测上做——而这种交集评测的数量本身就很少。
另一个值得关注的反例:FrontierCode 1.1 在 Max effort 下,Sonnet 5.5 得分 46.2%,反低于次高档位 Xhigh 的 52.1%。Anthropic 承认这是 Max 模式下过度推理触发了频繁的代码审查与子任务拆分,导致任务超时或超出范围。这意味着在智能体编程场景中,"开最高算力档位"不必然带来更好结果——选型与 API 调用层面的参数选择正在成为新变量。
关键变化二:成本叙事从"每百万 token"迁移到"每任务",隐性与显性的两套打法
9 月 23 日 OpenAI 发布 GPT-6 Sol/Luna 时,强调"永久降价 50%"和"任务计价"转向(详见 /news/gpt6-sol-luna-price-cut-launch);5 天后 Anthropic 拿出 Sonnet 5.5,价格一字不动,但给出另一套叙事:API 名义成本不变,单任务综合成本最高降低 30%。
官方解释的机制是 Sonnet 5.5 通过减少冗余推理和工具调用实现这一目标。36氪转引 Anthropic 数据:在一些需要持续调用工具、反复执行步骤的 agentic 任务中,Sonnet 5.5 单项任务综合成本最高降低 30%。Anthropic 研究产品经理 Theo Chu 在 CNBC 采访中明确:Sonnet 主要面向对成本比较敏感、但不需要顶级智能水平的客户。
这与 9/23 GPT-6 Sol 的"1/11 价格"叙事形成镜像。OpenAI 是显性降价 + 任务成本叙事;Anthropic 是价格不变 + 隐性优化降本。两条路径对用户的实际意义不同:OpenAI 的路径让你"看到的报价变低",Anthropic 的路径让你"实际账单变小但看起来不变"——后者在企业预算审批时反而更顺畅(不需要重谈合同)。
对智能体开发者的直接含义是,Anthropic 提供最高 90% 的提示词缓存折扣,加上 Sonnet 5.5 自身的 token 优化,长上下文/重复上下文的场景成本曲线进一步下移。在 Sonnet 5.5 上跑 Claude Code 或 Cursor 类工具时,单次重跑同一仓库的成本预期会比 Sonnet 5 更低。
关键变化三:Claude 5.5 系列的分工正在固化:Opus/Sonnet/Haiku 三档对应三档成本与任务
Anthropic 在 9/28 博客中确认 Haiku 5.5 将在未来几周内推出。届时 Claude 5.5 系列将形成完整三档:Opus 5.5 主管复杂推理与持续判断;Sonnet 5.5 主管软件开发、办公自动化、大量日常 agentic 任务;Haiku 5.5 将覆盖高吞吐、低成本的轻量级任务(具体参数与定价尚未公布)。
这一分工与 OpenAI GPT-6 系列的 Sol/Luna 双发策略存在结构差异:OpenAI 把 GPT-6 Astra 仍作为最强旗舰,Sol 和 Luna 是同一基座下的两个变体;Anthropic 把 5.5 系列的三个子型号定位为三个不同任务档位。
对选型者最实际的问题是:什么时候用 Opus 5.5,什么时候用 Sonnet 5.5?Anthropic 自己的回答偏泛——"需要复杂判断的用 Opus,well-scoped 任务用 Sonnet"——但 Sonnet 5.5 在 Terminal-Bench 上反超 Opus 5.5 这一事实,使这一规则出现裂缝。Anthropic 9/28 博客对此的处理是:在多张图表中指出"Sonnet 5.5 at Max effort even performs comparably to Opus 5.5",并强调在多数基准上"Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment"——把焦点放在"开放性、长期判断"而非单一基准上。
百器AI 未实测,本文无法给出确切的选择建议。但基于公开信息,可以给出一条可作为初筛的指引:如果你的任务是结构化、可重复、有标准答案——选 Sonnet 5.5 即可;如果任务需要长链路推理与多目标权衡、且你能容忍更高成本——选 Opus 5.5;如果是大批量轻量任务(分类、抽取、批量生成),等 Haiku 5.5。
选型建议:与 Opus 5.5、GPT-6 Sol 怎么分场景用
如果你已经在 9/23 后用 GPT-6 Sol 或 Opus 5.5:Sonnet 5.5 出现的最重要含义不是"切换",而是"补一层"。Opus 5.5 适合长链路、需要持续判断的复杂任务;Sonnet 5.5 适合更短链路、但仍需工具调用与代码生成的日常任务——把它当作 Opus 5.5 之下、Haiku 5.5 之上的中间档使用,而不是替换。
如果你是智能体开发者,关心成本曲线:Sonnet 5.5 在 prompt caching + token 优化 + Anthropic 90% 缓存读取折扣三重叠加下,长上下文/重复上下文的边际成本比 Sonnet 5 更低。但 36氪与 Anthropic 都未披露实际生产环境的成本数字,建议跑你自己的真实任务做 A/B,而不是直接套厂商基准。
如果你的场景涉及网络安全/渗透测试相关 prompt:Sonnet 5.5 是首个带"高风险请求重定向到 Sonnet 5"机制的 Sonnet 子型号。这意味着在某些安全敏感场景中,Sonnet 5.5 会主动把任务转给 Sonnet 5 而不是自己执行——这是 Sonnet 系列首次具备此能力。Anthropic 没有公开哪些 prompt 类型会被识别为高风险,使用前建议联系 Anthropic 销售确认。
如果你是境内用户:通过官方 API 直连 Sonnet 5.5 在中国大陆的可用性未核验——本文不假设其可直接调用;Claude.ai 网页与官方 API 区域策略不同,请以 Anthropic 官方区域说明为准;本文不评价境内使用方案。
如果你的选型周期跨到 10 月:等 Haiku 5.5 发布再做最终决策。Anthropic 9/28 博客已经预告 Haiku 5.5 "in the coming weeks"——大批量轻量任务的成本曲线可能在 10 月被进一步压低,本批 Sonnet 5.5 只是中间档定型,不构成完整决策输入。
以上均为基于公开信息的编辑判断(EDITORIAL),百器AI 未对 Claude Sonnet 5.5 做任何实测;本文所有基准数据均来自 Anthropic 官方页面,未做独立复现;按 SKILL #47 价格属高时效字段,请在采购前以 Anthropic 官网最新定价为准。
常见问题
Claude Sonnet 5.5 什么时候发布的?
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5;距 9/23 发布 Claude Opus 5.5 仅 5 天。Haiku 5.5 将在未来几周内推出,5.5 系列的三档(Opus/Sonnet/Haiku)即将完整补齐。百器AI 于 9/30 核验并发布本文。
Sonnet 5.5 和 Opus 5.5 有什么区别?我应该选哪个?
Opus 5.5 适合复杂推理与持续判断的长链路任务,输入 $4/输出 $20;Sonnet 5.5 适合结构化、可重复、有标准答案的日常 agentic 任务与文档/代码编辑场景,输入 $2/输出 $10,价格为 Opus 5.5 的一半但保持 Sonnet 5 原价不变(通过 token 优化降本 30%)。选型时请用你自己的真实任务做 A/B——Anthropic 官方给出"complex, open-ended work requiring sustained judgment"作为用 Opus 的判断标准,但 Sonnet 5.5 在 Terminal-Bench 上反超 Opus 5.5 这一事实说明该标准在不同基准下不完全成立。
Sonnet 5.5 比 Sonnet 5 强多少?
按 Anthropic 官方 9/28 表格:Terminal-Bench 4.0 70.6% vs 10.3%(约 6.85 倍);CursorBench 4.0 55.5% vs 34.1%;OSWorld 2.1 80.1% vs 57.0%;Chartography 61.6% vs 15.6%。价格不变($2/$10),单任务综合成本最高降 30%。但所有数字均为厂商口径,无第三方独立复现。
Sonnet 5.5 的网络安全防护具体是什么?
Sonnet 5.5 是 Sonnet 系列首个在发布时就启用与 Opus 5 和 Fable 5.1 同等级 cyber safeguards 的型号。核心机制是高风险请求重定向——当系统识别到高风险网络攻击或渗透测试请求时,会将相关任务转交给 Sonnet 5 处理,以尽量避免此类请求被允许在更高级别模型上执行。Anthropic 没有公开哪些 prompt 类型会被识别为高风险。
Claude Sonnet 5.5 在中国大陆能用吗?
本文未做实测,按 Anthropic 官方区域说明以官网为准。Claude.ai 网页与官方 API 的区域策略不同;本文不评价境内使用方案,也不假设其可通过官方 API 直连使用。如需在境内使用,建议通过合规云服务(如 AWS Bedrock 已发布的 Sonnet 5.5 模型卡)或与 Anthropic 销售联系确认可用性。
Sonnet 5.5 与 9/23 发布的 GPT-6 Sol 比怎么样?
在 Anthropic 官方 9/28 表格中两者只在 3 个基准可对比:FrontierCode 1.1(GPT-6 Sol 49.3% vs Sonnet 5.5 Xhigh 52.1%)、GDPval-AA v2.1(GPT-6 Sol 1487 vs Sonnet 5.5 1844)、Chartography(GPT-6 Sol 53.6% vs Sonnet 5.5 61.6%)——三个基准上 Sonnet 5.5 均领先。但这些数字均为 Anthropic 单方报告,跨厂商对比无独立第三方复现;且 Terminal-Bench 4.0 上 GPT-6 Sol 未公开报告,无法直接对比。GPT-6 Sol 文章已于 9/24 发布(/news/gpt6-sol-luna-price-cut-launch),价格策略与 Sonnet 5.5 不同(GPT-6 Sol 走显性降价到 $2/$10,Sonnet 5.5 维持原价不变靠 token 优化降本),两者在用户实际账单上的最终差异取决于任务结构。