首页AI 资讯Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30%
Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30% 封面
产品发布2026-09-3011 分钟

Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30%

9 月 28 日 Anthropic 在 Opus 5.5 发布仅一周后推出 Claude Sonnet 5.5,作为 5.5 系列第二款模型。Sonnet 5.5 维持 $2/$10 的输入/输出价不变,但在 agentic coding 基准 Terminal-Bench 4.0 上取得 70.6%,比上一代 Sonnet 5 的 10.3% 高近 7 倍,并反超一周前发布的 Opus 5.5(66.4%)。Anthropic 同时把单任务综合成本最高降 30%、输出速度提升 30%+,并首次为 Sonnet 系列配上旗舰级网络安全防护机制。百器AI 未实测,所有基准为厂商口径,跨厂商对比数据来自官方同一张表。

Claude Sonnet 5.5Claude Opus 5.5AnthropicAgentic CodingAPI 价格智能体编程选型

核心结论

Anthropic 在 9 月 23 日与 9 月 28 日一周内连发 Opus 5.5 与 Sonnet 5.5;5.5 系列三档(Opus/Sonnet/Haiku)的产品分工正在固化,Haiku 5.5 即将补齐最后一段

Sonnet 5.5 价格不变($2/$10),但单任务综合成本最高降 30%——这是与 GPT-6 Sol/Luna 的"显性降价 + 任务计价"叙事不同的"隐性成本战":账单变小但合同价不动

Terminal-Bench 4.0 上 Sonnet 5.5(70.6%)首次反超一周前发布的 Opus 5.5(66.4%),是 Anthropic 自家表中罕见的 Sonnet 反超 Opus——但所有数字均为厂商口径,无第三方独立复现

FrontierCode 1.1 Max effort 下 Sonnet 5.5 反低于 Xhigh effort(46.2% vs 52.1%):智能体场景中"开最高算力档位"不必然带来更好结果,参数选择正在成为新变量

Sonnet 5.5 是 Sonnet 系列首个带旗舰级网络安全保障发布的型号:高风险请求会被主动重定向给 Sonnet 5 处理——这是 Sonnet 系列首次具备此能力

对选型者:把 Sonnet 5.5 视为 Opus 5.5 之下、Haiku 5.5 之上的中间档使用,而不是替换;大批量轻量任务的最终决策建议等 Haiku 5.5 在 10 月发布后再做

对比判断表

对比维度Claude Sonnet 5.5Claude Opus 5.5GPT-6 Sol
定位日常 agentic、文档、代码编辑、设计辅助复杂推理与持续判断、长链路任务编程等复杂工作负载
上下文 / 最大输出未公开(同 Opus 5.5 推测 100 万 / 12.8 万 token)100 万 / 12.8 万 token105 万 / 12.8 万 token
输入价(每百万)$2$4$2
输出价(每百万)$10$20$10
缓存读取$0.20(同 Sonnet 5)$0.2(降 60%)官方称默认更高命中率
Terminal-Bench 4.0(厂商口径)70.6%66.4%未公开报告
FrontierCode 1.1 Main(厂商口径)52.1% Xhigh / 46.2% Max54.4%49.3%
CursorBench 4.0(厂商口径)55.5%57.8%未公开报告
GDPval-AA v2.1(厂商口径)184418461487
单任务综合成本比 Sonnet 5 最高降 30%(官方称)较 Opus 5 降 40%(官方称)AutomationBench $0.27/任务(官方称)
百器AI 实测未实测未实测未实测

落地检查清单

确认你的任务是否属于 well-scoped 日常类——若是 Sonnet 5.5 已足够
对照你自己的真实任务跑 Sonnet 5.5 vs Sonnet 5 的 A/B,重点关注 token 消耗与完成率
成本按"每任务"而非"每百万 token"测算,纳入 Anthropic 90% 缓存折扣
网络安全/渗透测试相关 prompt 用户:联系 Anthropic 销售确认高风险重定向机制对实际任务的影响
境内用户:通过官方 API 直连 Sonnet 5.5 的可用性需以 Anthropic 区域说明为准
暂缓锁定长期 API 合约——Haiku 5.5 在未来几周推出,可能进一步压低大批量轻量任务的成本曲线
若涉及跨厂商对比:仅在 Anthropic 与 OpenAI 都报告的评测上做基准对照,其余一律标未测

发生了什么:9/28 Sonnet 5.5 上线,5.5 系列一周内连发两款

2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5,距离 9/23 发布 Claude Opus 5.5 仅 5 天。这是 Claude 5.5 系列的第二款模型,按此前官方公告,Haiku 5.5 将在未来几周内加入,形成 Opus/Sonnet/Haiku 三档完整矩阵。

Sonnet 5.5 的官方定位是 Opus 5.5 的"更快、更低成本"补充:Opus 处理需要仔细判断的复杂工作,Sonnet 承担范围明确的日常任务——修 bug、写文档、PPT、电子表格,以及需要稳定结构化输出的设计场景。Anthropic 在 9/28 官方博客中明确写道:"Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets."

价格策略与 9/23 的"API 永久半价"叙事完全不同。Opus 5.5 发布时是直接降输入/输出价,OpenAI 紧接着 GPT-6 Sol/Luna 同步降价;Sonnet 5.5 选择不调单价,而是通过"更少 token、更少工具调用、更快生成"把单任务实际成本最高压低 30%。这是一种隐性的成本战,而不是显性的价格战。

更值得注意的是,Sonnet 5.5 同时被配上旗舰级网络安全防护:Anthropic 在 9/28 博客中确认,它是 Sonnet 系列首款发布时就启用与 Opus 5 / Fable 5.1 同等级 cyber safeguards 的型号。Anthropic 没有把这一升级放在产品主标题,但放在安全段落本身就是一种信号——能力上探到一定阈值后,安全边界必须同步上移。

关键变化一:Terminal-Bench 4.0 上反超 Opus 5.5,但厂商口径无第三方复现

在 Anthropic 主导的智能体编程评测 Terminal-Bench 4.0 上,Sonnet 5.5 取得 70.6%,上一代 Sonnet 5 仅 10.3%,而一周前发布的 Opus 5.5 是 66.4%。这是 Anthropic 自家基准表中首次出现 Sonnet 子型号反超 Opus 子型号的场景。

同一张表还披露了 Sonnet 5.5 在 8 个评测上的得分:CursorBench 4.0 真实编辑器场景 55.5%(Sonnet 5: 34.1%;Opus 5.5: 57.8%);FrontierCode 1.1 Main 46.2% Max / 52.1% Xhigh(Sonnet 5: 42.4%;Opus 5.5: 54.4%;GPT-6 Sol: 49.3%);GDPval-AA v2.1 44 种职业真实工作测试 1844 分(Sonnet 5: 1449;Opus 5.5: 1846;GPT-6 Sol: 1487)。

必须诚实标注的限制:以上所有分数均为 Anthropic 官方口径,没有第三方独立复现;GPT-6 Sol 在 Terminal-Bench 4.0 上未公开报告,所以 Sonnet 5.5 vs GPT-6 Sol 在该基准上的对比不成立;跨厂商对比只能在 Anthropic 与 OpenAI 都报告了的评测上做——而这种交集评测的数量本身就很少。

另一个值得关注的反例:FrontierCode 1.1 在 Max effort 下,Sonnet 5.5 得分 46.2%,反低于次高档位 Xhigh 的 52.1%。Anthropic 承认这是 Max 模式下过度推理触发了频繁的代码审查与子任务拆分,导致任务超时或超出范围。这意味着在智能体编程场景中,"开最高算力档位"不必然带来更好结果——选型与 API 调用层面的参数选择正在成为新变量。

关键变化二:成本叙事从"每百万 token"迁移到"每任务",隐性与显性的两套打法

9 月 23 日 OpenAI 发布 GPT-6 Sol/Luna 时,强调"永久降价 50%"和"任务计价"转向(详见 /news/gpt6-sol-luna-price-cut-launch);5 天后 Anthropic 拿出 Sonnet 5.5,价格一字不动,但给出另一套叙事:API 名义成本不变,单任务综合成本最高降低 30%。

官方解释的机制是 Sonnet 5.5 通过减少冗余推理和工具调用实现这一目标。36氪转引 Anthropic 数据:在一些需要持续调用工具、反复执行步骤的 agentic 任务中,Sonnet 5.5 单项任务综合成本最高降低 30%。Anthropic 研究产品经理 Theo Chu 在 CNBC 采访中明确:Sonnet 主要面向对成本比较敏感、但不需要顶级智能水平的客户。

这与 9/23 GPT-6 Sol 的"1/11 价格"叙事形成镜像。OpenAI 是显性降价 + 任务成本叙事;Anthropic 是价格不变 + 隐性优化降本。两条路径对用户的实际意义不同:OpenAI 的路径让你"看到的报价变低",Anthropic 的路径让你"实际账单变小但看起来不变"——后者在企业预算审批时反而更顺畅(不需要重谈合同)。

对智能体开发者的直接含义是,Anthropic 提供最高 90% 的提示词缓存折扣,加上 Sonnet 5.5 自身的 token 优化,长上下文/重复上下文的场景成本曲线进一步下移。在 Sonnet 5.5 上跑 Claude Code 或 Cursor 类工具时,单次重跑同一仓库的成本预期会比 Sonnet 5 更低。

关键变化三:Claude 5.5 系列的分工正在固化:Opus/Sonnet/Haiku 三档对应三档成本与任务

Anthropic 在 9/28 博客中确认 Haiku 5.5 将在未来几周内推出。届时 Claude 5.5 系列将形成完整三档:Opus 5.5 主管复杂推理与持续判断;Sonnet 5.5 主管软件开发、办公自动化、大量日常 agentic 任务;Haiku 5.5 将覆盖高吞吐、低成本的轻量级任务(具体参数与定价尚未公布)。

这一分工与 OpenAI GPT-6 系列的 Sol/Luna 双发策略存在结构差异:OpenAI 把 GPT-6 Astra 仍作为最强旗舰,Sol 和 Luna 是同一基座下的两个变体;Anthropic 把 5.5 系列的三个子型号定位为三个不同任务档位。

对选型者最实际的问题是:什么时候用 Opus 5.5,什么时候用 Sonnet 5.5?Anthropic 自己的回答偏泛——"需要复杂判断的用 Opus,well-scoped 任务用 Sonnet"——但 Sonnet 5.5 在 Terminal-Bench 上反超 Opus 5.5 这一事实,使这一规则出现裂缝。Anthropic 9/28 博客对此的处理是:在多张图表中指出"Sonnet 5.5 at Max effort even performs comparably to Opus 5.5",并强调在多数基准上"Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment"——把焦点放在"开放性、长期判断"而非单一基准上。

百器AI 未实测,本文无法给出确切的选择建议。但基于公开信息,可以给出一条可作为初筛的指引:如果你的任务是结构化、可重复、有标准答案——选 Sonnet 5.5 即可;如果任务需要长链路推理与多目标权衡、且你能容忍更高成本——选 Opus 5.5;如果是大批量轻量任务(分类、抽取、批量生成),等 Haiku 5.5。

选型建议:与 Opus 5.5、GPT-6 Sol 怎么分场景用

如果你已经在 9/23 后用 GPT-6 Sol 或 Opus 5.5:Sonnet 5.5 出现的最重要含义不是"切换",而是"补一层"。Opus 5.5 适合长链路、需要持续判断的复杂任务;Sonnet 5.5 适合更短链路、但仍需工具调用与代码生成的日常任务——把它当作 Opus 5.5 之下、Haiku 5.5 之上的中间档使用,而不是替换。

如果你是智能体开发者,关心成本曲线:Sonnet 5.5 在 prompt caching + token 优化 + Anthropic 90% 缓存读取折扣三重叠加下,长上下文/重复上下文的边际成本比 Sonnet 5 更低。但 36氪与 Anthropic 都未披露实际生产环境的成本数字,建议跑你自己的真实任务做 A/B,而不是直接套厂商基准。

如果你的场景涉及网络安全/渗透测试相关 prompt:Sonnet 5.5 是首个带"高风险请求重定向到 Sonnet 5"机制的 Sonnet 子型号。这意味着在某些安全敏感场景中,Sonnet 5.5 会主动把任务转给 Sonnet 5 而不是自己执行——这是 Sonnet 系列首次具备此能力。Anthropic 没有公开哪些 prompt 类型会被识别为高风险,使用前建议联系 Anthropic 销售确认。

如果你是境内用户:通过官方 API 直连 Sonnet 5.5 在中国大陆的可用性未核验——本文不假设其可直接调用;Claude.ai 网页与官方 API 区域策略不同,请以 Anthropic 官方区域说明为准;本文不评价境内使用方案。

如果你的选型周期跨到 10 月:等 Haiku 5.5 发布再做最终决策。Anthropic 9/28 博客已经预告 Haiku 5.5 "in the coming weeks"——大批量轻量任务的成本曲线可能在 10 月被进一步压低,本批 Sonnet 5.5 只是中间档定型,不构成完整决策输入。

以上均为基于公开信息的编辑判断(EDITORIAL),百器AI 未对 Claude Sonnet 5.5 做任何实测;本文所有基准数据均来自 Anthropic 官方页面,未做独立复现;按 SKILL #47 价格属高时效字段,请在采购前以 Anthropic 官网最新定价为准。

常见问题

Claude Sonnet 5.5 什么时候发布的?

2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5;距 9/23 发布 Claude Opus 5.5 仅 5 天。Haiku 5.5 将在未来几周内推出,5.5 系列的三档(Opus/Sonnet/Haiku)即将完整补齐。百器AI 于 9/30 核验并发布本文。

Sonnet 5.5 和 Opus 5.5 有什么区别?我应该选哪个?

Opus 5.5 适合复杂推理与持续判断的长链路任务,输入 $4/输出 $20;Sonnet 5.5 适合结构化、可重复、有标准答案的日常 agentic 任务与文档/代码编辑场景,输入 $2/输出 $10,价格为 Opus 5.5 的一半但保持 Sonnet 5 原价不变(通过 token 优化降本 30%)。选型时请用你自己的真实任务做 A/B——Anthropic 官方给出"complex, open-ended work requiring sustained judgment"作为用 Opus 的判断标准,但 Sonnet 5.5 在 Terminal-Bench 上反超 Opus 5.5 这一事实说明该标准在不同基准下不完全成立。

Sonnet 5.5 比 Sonnet 5 强多少?

按 Anthropic 官方 9/28 表格:Terminal-Bench 4.0 70.6% vs 10.3%(约 6.85 倍);CursorBench 4.0 55.5% vs 34.1%;OSWorld 2.1 80.1% vs 57.0%;Chartography 61.6% vs 15.6%。价格不变($2/$10),单任务综合成本最高降 30%。但所有数字均为厂商口径,无第三方独立复现。

Sonnet 5.5 的网络安全防护具体是什么?

Sonnet 5.5 是 Sonnet 系列首个在发布时就启用与 Opus 5 和 Fable 5.1 同等级 cyber safeguards 的型号。核心机制是高风险请求重定向——当系统识别到高风险网络攻击或渗透测试请求时,会将相关任务转交给 Sonnet 5 处理,以尽量避免此类请求被允许在更高级别模型上执行。Anthropic 没有公开哪些 prompt 类型会被识别为高风险。

Claude Sonnet 5.5 在中国大陆能用吗?

本文未做实测,按 Anthropic 官方区域说明以官网为准。Claude.ai 网页与官方 API 的区域策略不同;本文不评价境内使用方案,也不假设其可通过官方 API 直连使用。如需在境内使用,建议通过合规云服务(如 AWS Bedrock 已发布的 Sonnet 5.5 模型卡)或与 Anthropic 销售联系确认可用性。

Sonnet 5.5 与 9/23 发布的 GPT-6 Sol 比怎么样?

在 Anthropic 官方 9/28 表格中两者只在 3 个基准可对比:FrontierCode 1.1(GPT-6 Sol 49.3% vs Sonnet 5.5 Xhigh 52.1%)、GDPval-AA v2.1(GPT-6 Sol 1487 vs Sonnet 5.5 1844)、Chartography(GPT-6 Sol 53.6% vs Sonnet 5.5 61.6%)——三个基准上 Sonnet 5.5 均领先。但这些数字均为 Anthropic 单方报告,跨厂商对比无独立第三方复现;且 Terminal-Bench 4.0 上 GPT-6 Sol 未公开报告,无法直接对比。GPT-6 Sol 文章已于 9/24 发布(/news/gpt6-sol-luna-price-cut-launch),价格策略与 Sonnet 5.5 不同(GPT-6 Sol 走显性降价到 $2/$10,Sonnet 5.5 维持原价不变靠 token 优化降本),两者在用户实际账单上的最终差异取决于任务结构。

可核验来源

相关工具

相关阅读

产品发布

GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值?

OpenAI Developers 2026-10-09 宣布在 API、Codex、ChatGPT Work 三端同步推出 GPT-6.1 Sol 的 Ultrafast 极速版:速度最高 8 倍,定价 6 倍(短上下文输入 $12、输出 $60/百万 token,>272K 输入翻倍),Codex/Work 端仅向 Pro 500、按量付费 Enterprise、配额制 Edu 开放。百器AI 未实测。

产品发布

Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%

Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。

产品发布

谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上

9 月 30 日谷歌发布 Gemini 4 Argon,官方称『迄今最先进的 AI 模型』:单次输出上限从 6.4 万 token 提至约 100 万,DeepSWE v1.1 软件工程评测 77.9% 官方称超过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。但 Argon 并未面向公众开放——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,付费 API 与 Google AI Ultra 用户在后续批次、日期未定。初始定价 $2/$10(每百万 token,缓存低 95%),发布期后涨至 $4/$20。同周 OpenAI 刚在 DevDay 发布 GPT-6.1 Sol 与智能体 Dots,彭博社同时报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问。百器AI 未实测,所有基准为谷歌官方口径。