Claude Haiku 5.5 最值得关注的用途,是把分类、资料提取、摘要和小范围代码处理这些高频工作做得更经济。已有 Haiku 4.5 工作流的开发者可以开始评估升级,但需要一起检查请求参数、Token 预算和响应解析。
Anthropic 于 2026 年 10 月 7 日发布这款模型,将它定位为面向高吞吐、低延迟任务的小模型,也适合在大型编程 Agent 中承担辅助步骤。复杂代码调查和开放式工程任务,仍需要与 Sonnet、Opus 等更强模型分别评估。官方发布说明
本文资料核验于 2026 年 10 月 9 日。能力数据来自 Anthropic 公布的评测,未进行本站独立性能或付费 API 对测;下文的任务示例和迁移请求用于说明评估方法,不代表已经取得同样结果。
Claude Haiku 5.5 的基本规格
Haiku 是 Claude 系列中面向速度和成本敏感任务的模型。5.5 支持文本、图片输入,输出文本;在 Claude API 中使用固定模型 ID claude-haiku-5-5,没有日期后缀或单独的别名。
| 项目 | 当前官方规格 |
|---|---|
| 发布时间 | 2026 年 10 月 7 日 |
| Claude API 模型 ID | claude-haiku-5-5 |
| 上下文窗口 | 1M Tokens |
| 普通请求最大输出 | 128K Tokens |
| 输入与输出 | 文本、图片输入;文本输出 |
| 思考方式 | Adaptive thinking,默认开启 |
| API 默认 effort | medium |
Adaptive thinking 表示模型按任务决定如何思考;effort 用于调整思考投入。Haiku 5.5 是首款提供可调 effort 的 Haiku 模型。普通任务可以从较低投入开始评估,复杂任务则要观察质量、耗时和费用的变化,不能只按参数名称判断效果。模型概览
1M 上下文表示一次请求能处理的上下文容量,不是免费额度。它也不意味着每次都应该提交整个仓库;保留与任务相关的文件和事实,通常更方便验收结果。
相比 Haiku 4.5,哪些变化会影响实际使用
先看与 Haiku 4.5 的差异
| 比较项 | Haiku 4.5 | Haiku 5.5 | 升级时要检查什么 |
|---|---|---|---|
| AICodeWith 列出的模型 ID | claude-haiku-4-5-20251001 | claude-haiku-5-5 | 使用完整 ID,不填显示名称 |
| 控制台渠道上下文 | 200K | 1M | 容量增加,但提交的内容仍按用量计费 |
| 手动 thinking 预算 | 接受 enabled 和 budget_tokens | 改用 adaptive thinking 与 effort | 更新旧请求参数 |
| 相同文本的 Token 数 | 旧分词规则 | 官方说明约增加 30%,依内容而变 | 重算预算和输出上限 |
| 特价渠道输入 / 输出单价 | $0.19 / $0.95 | $0.019 / $0.095 | 单位为每百万 Tokens,需核对计费档位 |
模型 ID、渠道上下文及特价渠道报价取自 2026 年 10 月 9 日的 AICodeWith 控制台;thinking 与分词变化取自官方迁移指南。控制台展示的是平台渠道配置,不能据此推断所有云厂商或端点具有相同配置。下文的渠道表和算例使用同一时间点的页面报价。
任务能力提高,但编程仍要按范围选模型
Anthropic 的发布评测覆盖知识工作、计算机操作和编程。以 Terminal-Bench 4.0 为例,Haiku 5.5 为 39.2%,Haiku 4.5 为 0.0%;同表中的 Sonnet 5.5 为 70.6%。这些数字来自特定测试环境,不能换算成你的仓库任务成功率。
这组结果说明 Haiku 5.5 值得进入编程任务候选名单,也提醒开发者按任务难度分工。官方仍把 Sonnet 5.5 和 Opus 5.5 作为复杂 Agent 编程的更合适选择。Haiku 的升级价值,可以先在辅助任务上验证:读一份文件、提取事实、整理测试失败,或按已确定方案修改一个小模块。官方评测与任务定位
同样的文本,Token 数可能增加
Haiku 5.5 换用了新版 tokenizer,也就是将文本拆分为 Token 的规则。官方迁移指南说明,相同文本相较 Haiku 4.5 大约产生 30% 更多 Tokens,具体幅度随内容而变化。
因此,旧版的输入统计和 max_tokens 上限不能直接沿用。原先刚好能输出完整结果的上限,换模型后可能截断回答;预算计算也要重新测量输入和输出 Token 数。分词与预算变化
单价更低,任务费用仍受上下文和重试影响
以下为 Claude 官方直连 API 的美元价格,单位是每百万 Tokens;两档按请求的 prompt 大小区分。
| 计费项目 | Prompt 不超过 100K | Prompt 超过 100K |
|---|---|---|
| 输入 | $0.10 | $0.50 |
| 输出 | $0.50 | $2.50 |
| 缓存读取 | $0.01 | $0.05 |
作为对照,官方发布表中的 Haiku 4.5 输入、输出价格分别为 $1 和 $5。较小 prompt 档位的标价差距很大,但同样文本的 Token 数、思考输出、缓存和失败重试都会影响最终任务费用。价格表可以帮助筛选候选模型,实际节省应以完成同一任务的总账单计算。当前价格与规格
同一渠道下,4.5 与 5.5 的费用差多少
在支持多个模型的 API 中转站使用 Haiku 时,需要将供应商官方价与实际渠道报价分开。以下数据来自 AICodeWith 控制台模型列表中两款模型的渠道详情,核对日期为 2026 年 10 月 9 日。全部金额为美元 / 百万 Tokens,表内数字是当时页面展示价。
| 渠道 | 4.5 输入 / 输出 | 5.5 输入 / 输出 | 4.5 / 5.5 缓存读取 | 4.5 / 5.5 缓存写入 |
|---|---|---|---|---|
| 第三方claude(3.9 折) | $0.39 / $1.95 | $0.039 / $0.195 | $0.039 / $0.0039 | $0.4875 / $0.0488 |
| 特价渠道(1.9 折) | $0.19 / $0.95 | $0.019 / $0.095 | $0.019 / $0.0019 | $0.2375 / $0.0238 |
| 企业混合池(6.5 折) | $0.65 / $3.25 | $0.065 / $0.325 | $0.065 / $0.0065 | $0.8125 / $0.0813 |
同渠道的输入、输出和缓存读取展示价,5.5 均为 4.5 的十分之一。缓存写入价格保留了控制台的四位小数,存在显示舍入。模型列表中的 $0.019 / $0.095 是特价渠道的展示价,不是所有渠道统一价。
页面没有在这些行中展开 Haiku 5.5 超过 100K prompt 的渠道阶梯价,也没有区分缓存写入有效期。官方直连有 100K 档位和不同缓存写入费率;不能把这张渠道表自动套到长上下文或任意缓存设置。下面只用短请求演示计算,正式预算应确认目标渠道的实际账单规则。
假设使用特价渠道,单次日志整理请求包含 20,000 个未缓存输入 Tokens、2,000 个输出 Tokens,没有重试、缓存写入或额外工具收费:
- Haiku 4.5:
20,000 ÷ 1,000,000 × $0.19 + 2,000 ÷ 1,000,000 × $0.95 = $0.0057。 - Haiku 5.5:
20,000 ÷ 1,000,000 × $0.019 + 2,000 ÷ 1,000,000 × $0.095 = $0.00057。
按相同计费 Token 数估算,1,000 次分别为 $5.70 和 $0.57。但相同 Token 数不等于相同文本;如果另作敏感性假设,5.5 的输入、输出用量都增加 30%,变成 26,000 和 2,600 Tokens,单次为 $0.000741,1,000 次为 $0.741,比上述 4.5 算例低 87%。这是人为设定的预算情景,不是官方保证,也不是实际调用结果。
缓存也可以单独算。若 5.5 的一次请求为 18,000 个缓存读取 Tokens、2,000 个未缓存输入 Tokens、2,000 个输出 Tokens,特价渠道展示价对应的费用为:
18,000 ÷ 1,000,000 × $0.0019 + 2,000 ÷ 1,000,000 × $0.019 + 2,000 ÷ 1,000,000 × $0.095 = $0.0002622。
这笔数额不包括此前建立缓存的写入费用;首次调用、缓存失效和失败重试应另外计入。后台显示的缓存命中率、可用性和延迟只是相应统计视图,缺少相同任务、样本量及完整时间窗口时,不能把它们写成本稿实测结果或长期性能承诺。
Haiku 5.5 适合承担哪些编程工作
选择任务时,可以先问:输入是否明确,输出是否容易检查,失败后是否能及时发现?满足这些条件的工作更适合先试 Haiku。
| 任务 | 怎样交给 Haiku 5.5 | 验收重点 |
|---|---|---|
| 整理失败日志 | 提供相关日志和测试名称,要求分类并引用错误位置 | 分类有依据,不凭空推断根因 |
| 查询代码或文档 | 指定文件与问题,要求返回位置和相关内容 | 引用确实存在,未遗漏关键条件 |
| 小范围代码修改 | 提供明确方案、允许改动的文件和测试命令 | 测试通过,Diff 没有无关修改 |
| 压缩上下文 | 要求保留已确认事实、未完成项和约束 | 后续任务能继续执行,重要信息仍在 |
这些是应用层任务设计建议,并非 Haiku 自带的四种固定模式。工具执行、文件访问和测试需要由客户端或 Agent 框架提供。
例如,一次失败构建产生数百行日志,可以让 Haiku 先提取失败测试、报错位置和相关文件。主 Agent 再结合代码判断根因并制定改动。这样分工的结果容易核对;是否能降低整体费用,还要把辅助调用和返工都计入。
如果问题涉及跨模块架构、间歇性故障或需求本身不清晰,应保留 Sonnet、Opus 的对照结果。即使某个辅助任务处理得很好,也不足以证明 Haiku 能接管整条工程链路。
一个可以手工验收的日志整理示例
以下日志是人为构造的说明材料,不是真实项目或 API 调用记录:
| FAILED tests/test_invoice.py::test_rounding |
| AssertionError: expected 10.00, got 9.99 |
| app/invoice.py:42 |
给模型的任务可以写成:“从日志中提取失败测试、错误文本和文件位置,每项引用对应原文。不要推断原因,不要修改文件,日志缺少的信息写成未知。”
验收时应得到失败测试 tests/test_invoice.py::test_rounding、错误文本 AssertionError: expected 10.00, got 9.99、位置 app/invoice.py:42。这些是从示例输入直接推导的验收答案,不是模型输出;“四舍五入实现错误”只是待调查假设,不能作为日志已证实的根因。
这个任务把提取与诊断分开,结果可以逐项与原文比对。通过后再测试更长日志、缺失文件位置和多条混杂报错,确认模型不会补造信息。
从 Haiku 4.5 迁移:先检查请求,再检查会话
下面针对直接调用 Messages API 的代码。托管 Agent、云厂商和第三方客户端的设置入口可能不同,具体支持范围应核对对应文档。官方托管 Claude Managed Agents 的迁移要求更简单,不能把它与自行维护 API 客户端混为一谈。
更新 thinking 和采样参数
旧版手动思考配置 thinking: {"type":"enabled","budget_tokens":N} 在 Haiku 5.5 中会返回 400。改为 adaptive thinking,并使用 output_config.effort 调节投入。
以下请求体展示官方文档中的迁移方式,未在本站运行;实际发送时还需要正确的 Messages API 端点、鉴权和请求头:
| { |
| "model": "claude-haiku-5-5", |
| "max_tokens": 16000, |
| "thinking": { "type": "adaptive" }, |
| "output_config": { "effort": "medium" }, |
| "messages": [ |
| { "role": "user", "content": "提取这份失败日志中的测试名称、错误位置和相关文件,并引用原文。" } |
| ] |
| } |
请求中省略 temperature、top_p、top_k 最容易避免旧默认值引起的兼容问题。非默认采样值有严格限制:例如 temperature: 0 或 top_p: 1 会返回 400。不要把旧客户端的采样配置自动带到新模型。请求参数迁移说明
按类型解析响应,不要固定读取第一个块
默认 adaptive thinking 可能使响应先出现 thinking block。代码若只读取 content[0],就可能拿不到最终文本。应按每个块的 type 处理文本、工具调用和思考块;工具循环中需要保留并原样回传相关 thinking blocks。
思考 Tokens 也占用 max_tokens。如果收到 stop_reason: "max_tokens",且只返回了思考块,应检查输出上限和 effort,而不是立即判定模型没有答案。业务代码还应处理 stop_reason: "refusal",Haiku 5.5 没有服务端自动 fallback。响应与停止原因
替换预填充,并核对历史会话重放
如果旧请求用最后一条 assistant 消息预填一段内容,让模型继续写,Haiku 5.5 会拒绝这种 assistant prefill。以 user 消息结束请求;需要固定输出格式时,使用当前平台支持的 structured outputs 或工具字段约束。
已有会话存储也要检查。Haiku 5.5 的 thinking blocks 只能在产生它们的账户或关联账户中使用;跨账户重放时,API 可能丢弃这些块而继续处理请求。修改 thinking block 之前的 system、tools 或历史消息,还会触发前缀绑定检查;旧账户是否返回错误取决于相关设置。回放会话时保留原先账户和历史前缀,新增内容追加到后面。会话迁移要求
使用 computer use 的开发者还需要额外迁移:在 Claude API 和 Google Cloud 上,旧的 computer_20250124 工具应替换为 computer_toolset_20260801,并更新工具分发与结果回传逻辑。这不是只换工具名称就完成的修改,具体步骤见官方迁移指南。已有 Haiku 4.5 Priority Tier 容量承诺的团队,也需要重新确认容量安排。
如何判断这次升级是否值得
先挑一个已经能验收的工作负载,比如失败日志分类。保留一批有正确答案的历史样本,分别用 Haiku 4.5 和 5.5 处理。固定输入、工具、权限、允许的重试次数和输出要求,思考设置则按各模型的兼容方式记录。
对每个样本记录:结果是否正确、是否遗漏、请求总耗时、输入与输出 Token 数、缓存用量、重试费用,以及人工修正时间。如果是代码修改,再检查测试结果和无关 Diff。这样能分清“每次请求便宜”和“一个任务更便宜”。
计算时,可以使用:每个通过验收任务的 API 成本 = 全部测试请求费用 ÷ 通过验收的任务数。失败请求也在分子里;人工修正成本另列。不要仅凭一个成功回答决定迁移全部流量。
先用这一类窄任务验证 Haiku 5.5,保留旧模型或更强模型的回退路径。确认输出正确、客户端兼容和预算可接受后,再扩大任务范围。


