Claude Haiku 5.5 API 价格怎么算?长上下文、缓存与渠道费用详解

核对 Claude Haiku 5.5 API 的官方价格、100K 输入档位与缓存读写费用,用可复算的案例解释 Batch、thinking 和渠道报价,并说明如何用 usage 核对账单。

34 分钟阅读
Claude Haiku 5.5 API 价格怎么算?长上下文、缓存与渠道费用详解

Claude Haiku 5.5 的 API 费用,需要先判断请求的输入是否超过 100K Tokens,再分别计算普通输入、缓存写入、缓存读取和输出。Claude 官方直连在 100K 以内的输入价是每百万 $0.10、输出 $0.50;超过阈值后,分别变为 $0.50 和 $2.50。

使用第三方渠道时,预算还要换成目标渠道的实际报价。低价模型、缓存命中和折扣不能互相替代:缓存命中会降低部分输入费用,却不会把一个超过 100K 的请求变成低价档。

本文核验于 2026 年 10 月 9 日。官方规则来自 Claude Platform 文档,渠道数据来自当天 AICodeWith 控制台。全部费用案例为假设计算,未进行付费请求或账单实测。模型能力和从旧版迁移的问题,详见 Haiku 5.5 升级与编程用途。

Claude Haiku 5.5 API 当前价格是多少

以下为 Anthropic 官方直连价格,单位是美元 / 百万 Tokens(MTok)。两个档位由单次请求的 prompt 输入总量决定,输出 Token 数不用于选择输入档位。

计费项目输入不超过 100K输入超过 100K
普通输入$0.10$0.50
输出$0.50$2.50
5 分钟缓存写入$0.125$0.625
1 小时缓存写入$0.20$1.00
缓存读取$0.01$0.05

Haiku 5.5 的 1M 上下文窗口表示容量,费用仍按适用档位计算。普通请求最大输出 128K Tokens,也不是赠送用量。官方模型规格

输入超过 100K,整笔请求怎样计费

官方价格文档明确规定,prompt 长度包含全部输入 Tokens,缓存读取和缓存写入也在其中。超过 100,000 Tokens 的请求使用高档费率,即使大部分内容已命中缓存;之前的请求仍保留各自适用的价格,不会追溯涨价。长上下文计费规则

100,000 与 100,001 Tokens 的差别

假设没有缓存,输出均为 5,000 Tokens,仅计算官方直连模型费用:

单次请求输入输入费用输出费用合计
99,000 Tokens0.099 × $0.10 = $0.00990.005 × $0.50 = $0.0025$0.0124
100,000 Tokens0.1 × $0.10 = $0.010.005 × $0.50 = $0.0025$0.0125
100,001 Tokens0.100001 × $0.50 = $0.05000050.005 × $2.50 = $0.0125$0.0625005

第三行按整个请求应用高档输入与输出费率,不是仅对超出的一个 Token 涨价。输入内容包含系统指令、历史消息、工具定义和图片等被计入的材料;不能只数用户刚输入的文字。

缓存命中后,仍可能进入高价档

假设有 80,000 个缓存读取 Tokens、30,000 个普通输入 Tokens、5,000 个输出 Tokens。输入总量是 110,000,应使用高档价格:

0.08 × $0.05 + 0.03 × $0.50 + 0.005 × $2.50 = $0.0315。

如果只用 30,000 个普通输入选择档位,会误用低价。缓存的作用是改变这 80,000 Tokens 的计费类别,输入总长度仍是 110,000。

一次请求的费用如何计算

模型费用由各类计费用量分别乘单价,再相加。所有 Token 数都先除以 1,000,000:

模型费用 = 普通输入量 × 输入单价 + 缓存写入量 × 对应写入单价 + 缓存读取量 × 读取单价 + 输出量 × 输出单价。

使用不同缓存有效期时,5 分钟和 1 小时写入应分别计算。额外收费的服务端工具、税费、汇率或服务商费用另列。一次 Agent 任务可能发起多次模型请求,需要汇总每一轮,而不是只算最后一条回答。

缓存什么时候省钱,首次写入要花多少

官方 5 分钟缓存写入单价为普通输入的 1.25 倍,1 小时为 2 倍,读取为普通输入的十分之一。首次写入存在费用,后续有效命中才使用读取价;重复发送相近内容不等于命中缓存。缓存定价与用量说明

假设一段 80,000 Tokens 的固定资料需要反复使用,每次新增 20,000 Tokens 的问题与上下文,输出 2,000 Tokens。每次输入合计正好 100K,使用官方低档价格:

情景计算单次费用
不用缓存0.1 × $0.10 + 0.002 × $0.50$0.011
首次建立 5 分钟缓存0.08 × $0.125 + 0.02 × $0.10 + 0.002 × $0.50$0.013
后续读取有效缓存0.08 × $0.01 + 0.02 × $0.10 + 0.002 × $0.50$0.0038

在这个情景中,首次写入加四次有效读取,总计 $0.013 + 4 × $0.0038 = $0.0282;五次全部不用缓存是 $0.055。假设资料前缀完全匹配、缓存一直有效且没有额外写入,才成立。更换固定资料、缓存失效或上下文继续增长,都要重新算。

Batch 和 thinking 会改变哪些费用

Claude 官方 Batch API 对输入和输出提供 50% 折扣。Haiku 5.5 的 Batch 普通输入 / 输出费率,在 100K 以内为 $0.05 / $0.25,超过 100K 为 $0.25 / $1.25。它适用于可以异步完成的任务,不应套到普通实时 Messages 请求上。官方 Batch 定价

例如,20,000 个普通输入和 2,000 个输出,普通直连费用为 0.02 × $0.10 + 0.002 × $0.50 = $0.003;相同计费用量走官方 Batch 为 $0.0015。这只是模型 Token 费用对照,不能据此认定某个网关也提供 Batch 折扣。

Haiku 5.5 默认开启 adaptive thinking。思考输出会占用输出预算,最终可见答案可能只是一部分。估算输出费用时使用 API 报告的 output_tokens,不要只数答案文字;改变 effort 后,也应重新观察输出用量。相关行为见官方模型概览与迁移指南。

渠道折扣怎样换成实际预算

通过支持多个模型的 API 中转站接入时,应使用自己的渠道报价,而不是套用官方直连折扣。以下是 AICodeWith Haiku 5.5 模型详情在核验日展示的美元 / 百万 Tokens 价格:

渠道输入输出缓存读取缓存写入
第三方claude(3.9 折)$0.039$0.195$0.0039$0.0488
特价渠道(1.9 折)$0.019$0.095$0.0019$0.0238
企业混合池(6.5 折)$0.065$0.325$0.0065$0.0813

模型列表中的最低展示价来自特价渠道。三条渠道不是同一个单价,表中缓存写入保留了页面的显示舍入。

页面没有分别列出超过 100K 的渠道阶梯价、不同缓存写入有效期与 Batch 合同,因此这里不自行推导这些渠道的完整长上下文价目表。发送大请求前,应确认目标渠道适用费率;以下只按页面展示价演示短请求预算。

相同短请求,三条渠道分别花多少

假设一次请求有 20,000 个普通输入 Tokens、2,000 个输出 Tokens,没有缓存和额外工具费:

渠道单次计算单次费用1,000 次相同计费用量
第三方claude0.02 × $0.039 + 0.002 × $0.195$0.00117$1.17
特价渠道0.02 × $0.019 + 0.002 × $0.095$0.00057$0.57
企业混合池0.02 × $0.065 + 0.002 × $0.325$0.00195$1.95

这些数字仅依据核验日展示价计算,不包含重试或促销变化。折扣不能证明某条渠道的质量、延迟或长期可用性更好。

怎样用 usage 核对账单,避免重复计算

Claude Messages API 的 input_tokens 表示未用于缓存创建或读取的输入,不能把它当作整段 prompt 的总量。官方缓存文档给出的输入合计是:

总输入 = input_tokens + cache_creation_input_tokens + cache_read_input_tokens。

先用这个合计判断 100K 档位,再按三类输入分别计价。若有两种缓存写入有效期,依据返回的 cache_creation 细项拆分;不要同时把总输入乘普通输入价,再额外加缓存价,否则会重复计费。

下面是人为构造的用量示例,不是实际 API 响应:

字段假设用量应怎样计价
input_tokens10,000普通输入费率
cache_creation_input_tokens0本次无缓存写入
cache_read_input_tokens80,000缓存读取费率
output_tokens2,000输出费率,使用API报告值

输入合计为 90,000 Tokens。若按特价渠道展示价估算:0.01 × $0.019 + 0.08 × $0.0019 + 0.002 × $0.095 = $0.000532。这笔请求不包含之前建立缓存的写入成本。

核对实际账单时,保存请求时间、模型 ID、实际渠道、usage 和扣费金额,逐笔比对。网关可能有自己的字段或计费记录,应核对其定义,不能假定所有接口的 input_tokens 都与 Claude 原生语义相同。

结论

Haiku 5.5 的预算可以按明确顺序计算:先确定调用路径和渠道,再汇总全部输入判断档位,最后分开计算普通输入、缓存写入、缓存读取和输出。官方超过 100K 的请求会整体进入高价档;缓存命中不会改变输入总长度。

做正式预算前,选一项有验收标准的任务,记录完整请求链路的用量和扣费。本文算例可用于检查公式,实际月度费用还要加入重试、工具及缓存失效带来的支出。

常见问题

Haiku 5.5 API 是月费还是按量收费?

本文讨论的是按模型 Tokens 和相关服务费用计费的 API。Claude 网页订阅、平台充值余额和某条 API 渠道是不同产品,不应直接把订阅月费换算成固定 Token 配额。

输入刚好 100K,输出会触发高价档吗?

官方按 prompt 输入总量选择档位。输入正好 100,000 Tokens 属于低档;输出另按对应档位的输出费率收费。缓存读取、写入同样计入输入总量。

命中缓存后,输出也会打折吗?

缓存命中只改变对应输入的计费类别。输出仍有独立单价,缓存创建也有自己的写入费用。

控制台最低价能用于所有渠道和长请求吗?

不能。列表最低价对应具体渠道;详情页未展开的长上下文、缓存有效期和 Batch 条件,应另外确认,不自行按折扣补全。

从 Haiku 4.5 换到 5.5,费用一定降九成吗?

单价比例不能直接代表任务节省。新版分词方式改变 Token 数,思考、重试和请求跨档也会改变总费用;应重新测量同一任务的计费用量。

来源与延伸阅读