Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%
Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。
核心结论
单价与账单是两个数字:官方公告写「平均运行成本降低约 75%」,而 10 万 token 以内的单价降幅是 90%($1/$5 → $0.10/$0.50)。差额来自请求长度分布与新分词器——官方文档明确写同样文本在新分词器下约多 30% 的 token,网易智能转述称官方算 75% 时已把这两项算进去。
10 万 token 是这代 Haiku 最重要的价格分界线:跨过去单价直接跳到 5 倍($0.50/$2.50)。官方称上代约 90% 的请求在界内,但界附近的请求迁移后必须重新计数,否则预算会失准——这是本次迁移最容易被忽略的技术细节。
官方基准几乎全线跳升(OSWorld 15.7%→72.4%、Terminal-Bench 4.0 0%→39.2%、GDPval 735→1620),但全部是厂商口径且无第三方复现;第三方 Artificial Analysis 的数字同时暴露短板:AA-Omniscience 36%、AutomationBench-AA 35%(疑似安全策略过度拒绝)——强项与弱项都出现在官方表之外。
effort 参数是这代 Haiku 的双刃剑:五档可调让成本可控,但 high/max 下思考块变长、输出单价是输入的 5 倍。dev.to 的分析引用测试者说法称 max effort 下单任务成本可能高于 Sonnet 5.5 的 low effort——「便宜的模型」和「便宜的用法」是两件事。
Anthropic 这次不是单点发布而是「全线调价」:Haiku 5.5 降价 + Sonnet 5.5 缓存读取腰斩至 $0.10 + 订阅者每月 API 额度,三条一起构成对 GPT-6 Luna 定价($0.10/$0.50)的正面回应。腾讯科技称之为「全线调价」,措辞与官方「改进模型组合的价值」一致。
「与 Luna 价格持平」只在 10 万 token 以内成立:按 Willison 列出的价格,Luna 要到 27.2 万 token 以上才进长档($0.20/$0.75),仍低于 Haiku 5.5 长档的 $0.50/$2.50。引用价格时必须带「10 万 token 以内」这个前置条件。
官方自己的边界很清楚:Haiku 是高吞吐子代理,复杂智能体编码仍推荐 Sonnet/Opus。第三方开发者实测中有「更快但更多 token、更多错误」并切回 GPT-6 Luna 的案例——把 Haiku 5.5 当「便宜版 Sonnet」用是最常见的误用方向。
迁移成本被低估:官方文档列出多条破坏性变更(手动 extended thinking 报错、sampling 参数报错、assistant prefill 报错、computer use 工具更名、历史轮次改动使 thinking 失效、响应可能以 thinking 块开头、新增 refusal 停止原因),已上生产的集成方需要改代码,而不是只换一个模型 ID。
本文所有数字为官方口径或第三方转述,百器AI 未实测;厂商基准无第三方复现,价格与规格请以 Anthropic 官方公告页与 Claude 平台文档为准。
对比判断表
| 对比维度 | Claude Haiku 5.5 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|---|
| 上下文窗口 / 最大输出 | 1M token / 128K token(官方文档) | 1M token / 128K token(官方文档) | 1M token / 128K token(官方文档) |
| 输入 / 输出单价(每百万 token,10 万 token 以内档) | $0.10 / $0.50(官方标价) | $2.00 / $10.00(官方标价,无 10 万 token 分档) | $4.00 / $20.00(官方标价,无 10 万 token 分档) |
| 输入 / 输出单价(超过 10 万 token 档) | $0.50 / $2.50(官方标价,基础价 5 倍) | 官方未列长提示词分档 | 官方未列长提示词分档 |
| 缓存读取(每百万 token) | $0.01(≤10 万 token 档)/$0.05(>10 万 token 档) | $0.10(本次由 $0.20 下调 50%,官方称多数智能体任务便宜约 20%) | 官方未在本次公告中披露(NEEDS_VERIFICATION) |
| 默认 effort / 延迟定位 | medium / Fastest(官方文档称最快) | high / Fast | medium / Moderate |
| 官方基准:Terminal-Bench 4.0(智能体编码) | 39.2% | 70.6% | 官方未在本次公告基准表中列出 |
| 官方基准:GDPval-AA v2.1(知识工作) | 1620 | 1840 | 官方未在本次公告基准表中列出 |
| 官方基准:OSWorld 2.1(计算机操作,离线子集) | 72.4% | 83.9% | 官方未在本次公告基准表中列出 |
| 知识截止日期 | 2026 年 6 月(官方文档) | 2026 年 6 月(官方文档) | 2026 年 6 月(官方文档) |
| 官方定位 | 高吞吐、延迟敏感:分类 / 路由 / 抽取 / 子代理 | 通用主力,可作复杂编码与智能体主线 | 高能力高成本档,官方默认 medium effort |
| 本次是否公布新价格 | 是,全面下调并新增长提示词分档 | 是,仅缓存读取价从 $0.20 降至 $0.10 | 否,本次公告未调整 |
落地检查清单
发生了什么:美国时间 10 月 7 日上线,一次「全线调价」式发布
Anthropic 发布 Claude Haiku 5.5,模型 ID 为 `claude-haiku-5-5`。这里先交代一个日期口径:官方公告页(anthropic.com/claude-haiku-5-5)顶部标注的是「October 7, 2026」(美国时间),中文媒体在 10 月 8 日报道——腾讯科技明确写「美国当地时间10月7日」,环球网则写「10月8日消息,人工智能企业 Anthropic 近日正式发布」。本站发布日历按 2026-10-08 记录,但发布日期以官方页面的美国时间 10 月 7 日为准。
官方对它的定位是「我们发布过的、最便宜、最快、能力最强的小模型」,面向高吞吐、成本敏感的任务——摘要、压缩、数据库查询、分类请求;同时可以作为 Opus 5.5 与 Sonnet 5.5 在编码工作中的子代理。官方还称它目前是自家最快的模型,适合实时客服与浏览器操作这类速度敏感场景。官网给出的客户案例包括 Asana(称任务完成延迟降低 30% 以上、每代理轮次推理速度最高提升 2.5 倍)、Box(称比 Haiku 4.5 高 11 分、延迟约一半)与 Rogo(大模型做演示文稿、Haiku 去翻年报找收入数字)。注意这些都是官方引述的客户自述,不是第三方独立评测。
这次不是单点发布,而是一次「全线调价」。同一天,Anthropic 把 Claude Sonnet 5.5 的缓存读取价格腰斩($0.20 → $0.10/百万 token),官方称这会让 Sonnet 5.5 在大多数智能体任务上便宜约 20%;同时为 Claude Max 与 Team 订阅者推出每月 API 额度。腾讯科技把这次发布概括为「更像是 Anthropic 的一次全线调价」,这个判断与官方公告里「改进我们模型组合的价值」的措辞是对得上的。
规格上,Haiku 5.5 的上下文窗口为 1M token(Haiku 4.5 是 200K),最大输出 128K token(Haiku 4.5 是 64K),Batch API 的扩展输出 beta 可达 300K token。它也是首款支持 effort(推理强度)调节的 Haiku 模型,自适应思考默认开启,默认 effort 为 medium。价格则明确分成两档:提示不超过 10 万 token 时,输入 $0.10/百万 token、输出 $0.50/百万 token;超过 10 万 token 后跳到 $0.50/$2.50。
价格:10 万 token 是分界线,「降 90%」是单价,「降约 75%」才是官方口径的账单
先把官方价格表读清楚(全部为 Anthropic 官方标价)。Haiku 5.5 在不超过 10 万 token 的档位:输入 $0.10、输出 $0.50、缓存读取 $0.01、5 分钟缓存写入 $0.125、1 小时缓存写入 $0.20(单位均为每百万 token);超过 10 万 token 的档位:输入 $0.50、输出 $2.50、缓存读取 $0.05、5 分钟缓存写入 $0.625、1 小时缓存写入 $1。Batch API 在输入与输出上均享 50% 折扣。对照组 Haiku 4.5 是输入 $1.00、输出 $5.00、缓存读取 $0.10、缓存写入 $1.25。
由此可以直接算出两个单价降幅:10 万 token 以内降约 90%,超过 10 万 token 降约 50%。但官方公告给出的口径不是 90%,而是「平均运行成本降低约 75%」。差额来自两处。第一处是长度分布:官方称上一代 Haiku 约 90% 的请求在 10 万 token 以内,剩下 10% 落在长档。第二处是新分词器——官方文档明确写:Haiku 5.5 使用与 Claude 4.7 及之后模型相同的新分词器,同样的输入文本产生的 token 数比 Haiku 4.5 多约 30%。网易智能转述称,官方计算 75% 平均降幅时「已经考虑了不同长度请求的价格,以及新分词器带来的 token 用量变化」。
分词器的实际涨幅,第三方测出来的数字和官方口径略有出入。开发者 Simon Willison 用同一段长提示词测试,发现 Haiku 5.5 的计数比 4.5 多约 25%(官方文档口径为约 30%,实际取决于内容类型——这个差异我们保留为待核实项)。dev.to 的分析文章把这件事称为「分词器税」:单价降 90%,落到账单上大约变成降 75%,「是真实的折扣,但有一个悬崖」。
那个悬崖就是 10 万 token 分界线上的 5 倍跳价。接近这条线的请求,迁移后必须重新计数——原本按低价档计费的输入很可能跳进长档。同时要提醒:长档并不比竞争对手便宜。按 Willison 列出的价格(网易智能转述),GPT-6 Luna 要到 27.2 万 token 以上才进入长上下文收费档,届时输入/输出为 $0.20/$0.75,仍低于 Haiku 5.5 长档的 $0.50/$2.50。所以「Haiku 5.5 与 Luna 价格持平」这句话只在 10 万 token 以内成立。以上价格均为官方标价,百器AI 未做账号级账单实测。
能力:官方基准几乎全线跳升,第三方测评却指出事实知识与自动化两项短板
官方公告页给出的基准表(以下全部为 Anthropic 厂商口径,无第三方复现):GDPval-AA v2.1 知识工作,Haiku 5.5 得 1620,Haiku 4.5 为 735,GPT-6 Luna 1437,Sonnet 5.5 1840;AA-Briefcase v1.1,Haiku 5.5 1578、Haiku 4.5 614、Luna 1336、Sonnet 5.5 1824;OSWorld 2.1 计算机操作(离线子集、允许部分完成计分),Haiku 5.5 72.4%、Haiku 4.5 15.7%、Luna 48.9%、Sonnet 5.5 83.9%;Humanity's Last Exam,Haiku 5.5 无工具 45.9%/有工具 57.4%,Haiku 4.5 为 10.2%/18.7%,Sonnet 5.5 为 56.9%/64.5%(Luna 该项官方表内留空);Terminal-Bench 4.0 智能体编码,Haiku 5.5 39.2%、Haiku 4.5 0.0%、Luna 16.4%、Sonnet 5.5 70.6%;FrontierCode 1.1(Main),Haiku 5.5 46.4%、Luna 42.4%、Sonnet 5.5 52.1%;Chartography 视觉推理(无工具),Haiku 5.5 46.4%、Haiku 4.5 6.4%、Luna 29.1%、Sonnet 5.5 61.6%。
从这张表能读出两个方向。向上的部分是代际跳升确实很大——OSWorld 从 15.7% 到 72.4%、Terminal-Bench 4.0 从 0% 到 39.2%、GDPval 从 735 到 1620,这不是常规迭代幅度。在官方同一张表里,Haiku 5.5 在所有与 GPT-6 Luna 共有的项目上都领先。向下的部分是它仍然明显低于自家 Sonnet 5.5:Terminal-Bench 4.0 是 39.2% 对 70.6%,OSWorld 是 72.4% 对 83.9%,GDPval 是 1620 对 1840。官方在公告里也把 Haiku 定位为「配合 Opus 5.5 与 Sonnet 5.5 的子代理」,而不是替代品。
第三方数字出现了更有意思的分歧。腾讯科技转述 Artificial Analysis 的数据:Haiku 5.5 智能指数 43 分,比 Haiku 4.5 提升 26 分,略高于 GLM-5.3 Flash(42)与 Gemini 3.8 Flash(41),与 Kimi K3(44)相当,低于 Sonnet 5.5(56)——这组数字支持「小模型档次跃升」的结论。但同一来源也给出两项明显偏低的成绩:AA-Omniscience 事实知识准确率只有 36%(Gemini 3.8 Flash 55%、GPT-6 Luna 44%);AutomationBench-AA 只拿到 35%,而 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 都在 53%–60% 之间。Artificial Analysis 认为 AutomationBench 的低分可能与安全策略导致的过度拒绝有关,Anthropic 正在修复,修复后分数预计会上升——这条归因目前只有第三方说法,未见 Anthropic 官方确认。
能力之外还有两块值得单独看。一是 effort:Haiku 5.5 提供 low/medium/high/xhigh/max 五档,默认 medium(腾讯科技转述),这是首款可调的 Haiku。二是新增与破坏性变更:官方文档新增了浏览器操作工具(可用范围为 Claude API 与 Google Cloud),安全分类器可直接拒答并返回 `stop_reason: "refusal"`,且没有服务端 fallback;同时列出多条破坏性变更——手动 extended thinking 会报错(需改用自适应思考)、`temperature`/`top_p`/`top_k` 会报错、assistant prefill 会报错、computer use 需从 `computer_20250124` 换成 `computer_toolset_20260801`、修改较早轮次会使 thinking 块失效。
缺点与适用边界:它该待在「轻量高频」,不该被推到复杂智能体编码
最先要说清楚的是官方自己的定位边界。Anthropic 把 Haiku 5.5 的能力面描述为摘要、压缩、数据库查询、分类这类高吞吐任务,以及在编码工作中充当 Opus 5.5 / Sonnet 5.5 的子代理;对于复杂智能体编程,官方仍建议优先选择 Sonnet 或 Opus(网易智能转述,并引用 Terminal-Bench 4.0 上 39.2% 对 70.6% 的差距)。把 Haiku 5.5 当成「便宜版 Sonnet」整体替换,是目前最容易踩的误用方向。
开发者的实测反馈也出现分歧,而且负面的一侧很具体。网易智能记录了两位开发者的测试:Kacper Kapuściak 把一套智能体端到端测试从 GPT-6 Luna 换到 Haiku 5.5,观察到「运行更快,但用了更多 token,错误也更多」,最后把测试切回 Luna;另一位开发者 James 在内部测试中累计跑了五轮,认为 Haiku 5.5 的表现仍不及 Luna。同一来源还记录了两项对比测试:熔岩灯项目中 Haiku 5.5「完全无法通过」,耗时 4 分 34 秒、成本 0.03 美元,而 GPT-6 Luna 在 42.8 秒内完成、成本不到一美分;火箭发射测试中 Haiku 耗时 6 分 58 秒、0.05 美元,Luna 用时 1 分 5 秒、不到一分钱。必须说明:这些都是个人或小样本测试,不是评测机构的系统复现。
「结构性啰嗦」是被点名最多的隐性成本来源。dev.to 的分析指出,在 high/max effort 下模型会先写较长的思考块,而输出单价是输入单价的 5 倍($0.50 对 $0.10),推理越深账单越重;该文还引用独立分析称有测试者在 max effort 下单任务成本可能高于用 Sonnet 5.5 的 low effort。这条与官方「平均降约 75%」并不矛盾——75% 是平均口径,不是每一档 effort、每一类工作负载都成立。换句话说,便宜的是 token,不是产品:更便宜的 token 意味着你可以负担更多浪费,而 max effort 恰好被设计成会浪费。
安全方面,官方公告只给了定性描述:Haiku 5.5 的对齐评测相对 Haiku 4.5「几乎全面改善」,网络安全的防护比 Haiku 4.5 更严格、但比近期其他模型更宽松(允许比 Sonnet 5.5 更宽的防御性任务,仍会拦截渗透测试等更可能被攻击者使用的技术);生物领域的防护与 Sonnet 5、Sonnet 5.5、Opus 5 一致。官方未在公告正文披露具体安全分项数值与 ASL 定级——系统卡(claude-haiku-5-5-system-card)本次未能读取,因此这一项我们标为 NEEDS_VERIFICATION,不做推断。
怎么用:四类人群的实际含义
如果你跑的是高吞吐简单任务——分类、抽取、路由、摘要、压缩,这次是直接受益面。官方称上一代 Haiku 约 90% 的请求在 10 万 token 以内,正好落在低价档。但迁移前必须先重算 token:官方文档口径是同样文本在新分词器下约多 30% 的 token,接近 10 万 token 边界的请求可能跳档,预算模型要跟着改,不能沿用旧的 token 估算。
如果你要用长上下文,记住 1M 不等于 1M 便宜。上下文从 200K 扩到 1M 是这代 Haiku 最大的规格变化,但超过 10 万 token 后单价是 5 倍($0.50/$2.50),而且按 Willison 列出的价格,GPT-6 Luna 的长档(超过 27.2 万 token 后 $0.20/$0.75)比 Haiku 5.5 长档更低。长文档场景在下手前先把账单算出来,再决定用谁。
如果你在做复杂智能体编码,不建议整体替换 Sonnet 5.5 / Opus 5.5。官方自身定位是子代理,第三方开发者实测又出现「更快但更多 token、更多错误」并切回 Luna 的案例。更合理的用法是把已经拆解好的子任务交给 Haiku 5.5——检索一个数字、压缩一段历史、做一轮分类——主线推理仍留给 Sonnet 5.5 或 Opus 5.5。
对工程集成方与订阅用户,有两份清单要先过。集成方要处理官方文档列出的破坏性变更:替换 `budget_tokens` 为自适应思考、移除 `temperature`/`top_p`/`top_k`、不再使用 assistant prefill、把 computer use 换成 `computer_toolset_20260801`、保持对话 append-only、按 `type` 而不是位置读取内容块、并处理 `stop_reason: "refusal"`。订阅用户可以关注每月 API 额度:官方公告确认推出该额度,具体金额按网易智能转述为 Max 5x 每月 100 美元、Max 20x 每月 200 美元、Team 每团队每月最多共享 500 美元,仅用于 Claude 平台 API 调用,不提高 Claude 或 Claude Code 的订阅上限,未用完不结转。最后重申声明:百器AI 未对 Claude Haiku 5.5 做任何实测,本文所有价格、规格与基准数字均为官方口径或第三方转述,且厂商基准无第三方复现。
常见问题
Claude Haiku 5.5 到底便宜了多少?
两个数字要分开说。10 万 token 以内的单价从 Haiku 4.5 的输入 $1/输出 $5 降到 $0.10/$0.50,降幅约 90%;而官方公告给出的口径是「平均运行成本降低约 75%」。差额来自请求长度分布与新分词器——官方文档称同样的输入文本在新分词器下产生的 token 数比 Haiku 4.5 多约 30%,官方称上一代约 90% 的请求在 10 万 token 以内。以上均为官方标价与官方口径,百器AI 未做账单实测。
超过 10 万 token 会怎样?
单价跳到基础价的 5 倍:输入 $0.50/百万 token、输出 $2.50/百万 token(官方标价)。作为对照,按 Willison 列出的价格(网易智能转述),GPT-6 Luna 要到 27.2 万 token 以上才进入长档,届时为 $0.20/$0.75,仍低于 Haiku 5.5 长档。所以「与 Luna 价格持平」只在 10 万 token 以内成立。接近 10 万 token 的请求迁移后必须重新计数,可能跳档。
它的能力到什么水平?
官方基准显示相对 Haiku 4.5 是代际跳升:GDPval-AA v2.1 从 735 到 1620、AA-Briefcase 从 614 到 1578、OSWorld 2.1 离线子集从 15.7% 到 72.4%、Terminal-Bench 4.0 从 0% 到 39.2%、HLE 无工具从 10.2% 到 45.9%。这些全部是 Anthropic 厂商口径,无第三方复现;在官方同一张表里它仍低于 Sonnet 5.5(Terminal-Bench 39.2% 对 70.6%、OSWorld 72.4% 对 83.9%)。
有第三方测评吗?结论一致吗?
有,但结论更复杂。腾讯科技转述 Artificial Analysis 的数据:智能指数 43 分,比 Haiku 4.5 高 26 分,略高于 GLM-5.3 Flash(42)与 Gemini 3.8 Flash(41),与 Kimi K3(44)相当,低于 Sonnet 5.5(56)。但 AA-Omniscience 事实知识准确率只有 36%(Gemini 3.8 Flash 55%、GPT-6 Luna 44%),AutomationBench-AA 只有 35%(对手在 53%–60%),Artificial Analysis 归因于安全策略过度拒绝、Anthropic 正在修复。此外多位开发者自行测试出现分歧,有人反馈更快但更多 token 与错误并切回 GPT-6 Luna。
我升级需要改代码吗?
很可能需要。官方文档列出的破坏性变更包括:手动 extended thinking(budget_tokens)会直接报错、temperature/top_p/top_k 会报错、assistant message prefill 会报错、computer use 工具需从 computer_20250124 换成 computer_toolset_20260801、修改较早轮次会使 thinking 块失效。行为变化还包括:响应可能以 thinking 块开头(要按 type 而不是位置读取内容块)、thinking 文本默认不返回(需设 thinking.display 为 summarized)、安全分类器可能返回 stop_reason: "refusal" 且没有服务端 fallback。
Sonnet 5.5 的缓存降价对我有影响吗?
如果你在做智能体类应用,影响可能比 Haiku 5.5 本身更直接。官方把 Sonnet 5.5 的缓存读取价从 $0.20/百万 token 降到 $0.10/百万 token(降 50%),并称这会让 Sonnet 5.5 在大多数智能体任务上便宜约 20%。智能体连续工作时会反复读取相同的指令、文档与对话背景,缓存读取在 token 消耗里占比很高。注意 Sonnet 5.5 的缓存写入价仍为 $2.50/百万 token。
订阅用户能拿到什么额外额度?
官方公告确认推出了面向 Claude Max 与 Team 订阅者的每月 API 额度,用于 Claude 平台 API 调用。具体金额按网易智能转述为:Max 5x 每月 100 美元、Max 20x 每月 200 美元、Team 按席位汇总每团队每月最多共享 500 美元。这些额度不会提高 Claude 或 Claude Code 的订阅使用上限,未用完的部分也不结转到下个月。金额细节为媒体转述,本次未在官方页面正文逐条核实(NEEDS_VERIFICATION)。