Claude Haiku 5.5 的 API 费用,需要先判断请求的输入是否超过 100K Tokens,再分别计算普通输入、缓存写入、缓存读取和输出。Claude 官方直连在 100K 以内的输入价是每百万 $0.10、输出 $0.50;超过阈值后,分别变为 $0.50 和 $2.50。
使用第三方渠道时,预算还要换成目标渠道的实际报价。低价模型、缓存命中和折扣不能互相替代:缓存命中会降低部分输入费用,却不会把一个超过 100K 的请求变成低价档。
本文核验于 2026 年 10 月 9 日。官方规则来自 Claude Platform 文档,渠道数据来自当天 AICodeWith 控制台。全部费用案例为假设计算,未进行付费请求或账单实测。模型能力和从旧版迁移的问题,详见 Haiku 5.5 升级与编程用途。
Claude Haiku 5.5 API 当前价格是多少
以下为 Anthropic 官方直连价格,单位是美元 / 百万 Tokens(MTok)。两个档位由单次请求的 prompt 输入总量决定,输出 Token 数不用于选择输入档位。
| 计费项目 | 输入不超过 100K | 输入超过 100K |
|---|---|---|
| 普通输入 | $0.10 | $0.50 |
| 输出 | $0.50 | $2.50 |
| 5 分钟缓存写入 | $0.125 | $0.625 |
| 1 小时缓存写入 | $0.20 | $1.00 |
| 缓存读取 | $0.01 | $0.05 |
Haiku 5.5 的 1M 上下文窗口表示容量,费用仍按适用档位计算。普通请求最大输出 128K Tokens,也不是赠送用量。官方模型规格
输入超过 100K,整笔请求怎样计费
官方价格文档明确规定,prompt 长度包含全部输入 Tokens,缓存读取和缓存写入也在其中。超过 100,000 Tokens 的请求使用高档费率,即使大部分内容已命中缓存;之前的请求仍保留各自适用的价格,不会追溯涨价。长上下文计费规则
100,000 与 100,001 Tokens 的差别
假设没有缓存,输出均为 5,000 Tokens,仅计算官方直连模型费用:
| 单次请求输入 | 输入费用 | 输出费用 | 合计 |
|---|---|---|---|
| 99,000 Tokens | 0.099 × $0.10 = $0.0099 | 0.005 × $0.50 = $0.0025 | $0.0124 |
| 100,000 Tokens | 0.1 × $0.10 = $0.01 | 0.005 × $0.50 = $0.0025 | $0.0125 |
| 100,001 Tokens | 0.100001 × $0.50 = $0.0500005 | 0.005 × $2.50 = $0.0125 | $0.0625005 |
第三行按整个请求应用高档输入与输出费率,不是仅对超出的一个 Token 涨价。输入内容包含系统指令、历史消息、工具定义和图片等被计入的材料;不能只数用户刚输入的文字。
缓存命中后,仍可能进入高价档
假设有 80,000 个缓存读取 Tokens、30,000 个普通输入 Tokens、5,000 个输出 Tokens。输入总量是 110,000,应使用高档价格:
0.08 × $0.05 + 0.03 × $0.50 + 0.005 × $2.50 = $0.0315。
如果只用 30,000 个普通输入选择档位,会误用低价。缓存的作用是改变这 80,000 Tokens 的计费类别,输入总长度仍是 110,000。
一次请求的费用如何计算
模型费用由各类计费用量分别乘单价,再相加。所有 Token 数都先除以 1,000,000:
模型费用 = 普通输入量 × 输入单价 + 缓存写入量 × 对应写入单价 + 缓存读取量 × 读取单价 + 输出量 × 输出单价。
使用不同缓存有效期时,5 分钟和 1 小时写入应分别计算。额外收费的服务端工具、税费、汇率或服务商费用另列。一次 Agent 任务可能发起多次模型请求,需要汇总每一轮,而不是只算最后一条回答。
缓存什么时候省钱,首次写入要花多少
官方 5 分钟缓存写入单价为普通输入的 1.25 倍,1 小时为 2 倍,读取为普通输入的十分之一。首次写入存在费用,后续有效命中才使用读取价;重复发送相近内容不等于命中缓存。缓存定价与用量说明
假设一段 80,000 Tokens 的固定资料需要反复使用,每次新增 20,000 Tokens 的问题与上下文,输出 2,000 Tokens。每次输入合计正好 100K,使用官方低档价格:
| 情景 | 计算 | 单次费用 |
|---|---|---|
| 不用缓存 | 0.1 × $0.10 + 0.002 × $0.50 | $0.011 |
| 首次建立 5 分钟缓存 | 0.08 × $0.125 + 0.02 × $0.10 + 0.002 × $0.50 | $0.013 |
| 后续读取有效缓存 | 0.08 × $0.01 + 0.02 × $0.10 + 0.002 × $0.50 | $0.0038 |
在这个情景中,首次写入加四次有效读取,总计 $0.013 + 4 × $0.0038 = $0.0282;五次全部不用缓存是 $0.055。假设资料前缀完全匹配、缓存一直有效且没有额外写入,才成立。更换固定资料、缓存失效或上下文继续增长,都要重新算。
Batch 和 thinking 会改变哪些费用
Claude 官方 Batch API 对输入和输出提供 50% 折扣。Haiku 5.5 的 Batch 普通输入 / 输出费率,在 100K 以内为 $0.05 / $0.25,超过 100K 为 $0.25 / $1.25。它适用于可以异步完成的任务,不应套到普通实时 Messages 请求上。官方 Batch 定价
例如,20,000 个普通输入和 2,000 个输出,普通直连费用为 0.02 × $0.10 + 0.002 × $0.50 = $0.003;相同计费用量走官方 Batch 为 $0.0015。这只是模型 Token 费用对照,不能据此认定某个网关也提供 Batch 折扣。
Haiku 5.5 默认开启 adaptive thinking。思考输出会占用输出预算,最终可见答案可能只是一部分。估算输出费用时使用 API 报告的 output_tokens,不要只数答案文字;改变 effort 后,也应重新观察输出用量。相关行为见官方模型概览与迁移指南。
渠道折扣怎样换成实际预算
通过支持多个模型的 API 中转站接入时,应使用自己的渠道报价,而不是套用官方直连折扣。以下是 AICodeWith Haiku 5.5 模型详情在核验日展示的美元 / 百万 Tokens 价格:
| 渠道 | 输入 | 输出 | 缓存读取 | 缓存写入 |
|---|---|---|---|---|
| 第三方claude(3.9 折) | $0.039 | $0.195 | $0.0039 | $0.0488 |
| 特价渠道(1.9 折) | $0.019 | $0.095 | $0.0019 | $0.0238 |
| 企业混合池(6.5 折) | $0.065 | $0.325 | $0.0065 | $0.0813 |
模型列表中的最低展示价来自特价渠道。三条渠道不是同一个单价,表中缓存写入保留了页面的显示舍入。
页面没有分别列出超过 100K 的渠道阶梯价、不同缓存写入有效期与 Batch 合同,因此这里不自行推导这些渠道的完整长上下文价目表。发送大请求前,应确认目标渠道适用费率;以下只按页面展示价演示短请求预算。
相同短请求,三条渠道分别花多少
假设一次请求有 20,000 个普通输入 Tokens、2,000 个输出 Tokens,没有缓存和额外工具费:
| 渠道 | 单次计算 | 单次费用 | 1,000 次相同计费用量 |
|---|---|---|---|
| 第三方claude | 0.02 × $0.039 + 0.002 × $0.195 | $0.00117 | $1.17 |
| 特价渠道 | 0.02 × $0.019 + 0.002 × $0.095 | $0.00057 | $0.57 |
| 企业混合池 | 0.02 × $0.065 + 0.002 × $0.325 | $0.00195 | $1.95 |
这些数字仅依据核验日展示价计算,不包含重试或促销变化。折扣不能证明某条渠道的质量、延迟或长期可用性更好。
怎样用 usage 核对账单,避免重复计算
Claude Messages API 的 input_tokens 表示未用于缓存创建或读取的输入,不能把它当作整段 prompt 的总量。官方缓存文档给出的输入合计是:
总输入 = input_tokens + cache_creation_input_tokens + cache_read_input_tokens。
先用这个合计判断 100K 档位,再按三类输入分别计价。若有两种缓存写入有效期,依据返回的 cache_creation 细项拆分;不要同时把总输入乘普通输入价,再额外加缓存价,否则会重复计费。
下面是人为构造的用量示例,不是实际 API 响应:
| 字段 | 假设用量 | 应怎样计价 |
|---|---|---|
| input_tokens | 10,000 | 普通输入费率 |
| cache_creation_input_tokens | 0 | 本次无缓存写入 |
| cache_read_input_tokens | 80,000 | 缓存读取费率 |
| output_tokens | 2,000 | 输出费率,使用API报告值 |
输入合计为 90,000 Tokens。若按特价渠道展示价估算:0.01 × $0.019 + 0.08 × $0.0019 + 0.002 × $0.095 = $0.000532。这笔请求不包含之前建立缓存的写入成本。
核对实际账单时,保存请求时间、模型 ID、实际渠道、usage 和扣费金额,逐笔比对。网关可能有自己的字段或计费记录,应核对其定义,不能假定所有接口的 input_tokens 都与 Claude 原生语义相同。
结论
Haiku 5.5 的预算可以按明确顺序计算:先确定调用路径和渠道,再汇总全部输入判断档位,最后分开计算普通输入、缓存写入、缓存读取和输出。官方超过 100K 的请求会整体进入高价档;缓存命中不会改变输入总长度。
做正式预算前,选一项有验收标准的任务,记录完整请求链路的用量和扣费。本文算例可用于检查公式,实际月度费用还要加入重试、工具及缓存失效带来的支出。
常见问题
Haiku 5.5 API 是月费还是按量收费?
本文讨论的是按模型 Tokens 和相关服务费用计费的 API。Claude 网页订阅、平台充值余额和某条 API 渠道是不同产品,不应直接把订阅月费换算成固定 Token 配额。
输入刚好 100K,输出会触发高价档吗?
官方按 prompt 输入总量选择档位。输入正好 100,000 Tokens 属于低档;输出另按对应档位的输出费率收费。缓存读取、写入同样计入输入总量。
命中缓存后,输出也会打折吗?
缓存命中只改变对应输入的计费类别。输出仍有独立单价,缓存创建也有自己的写入费用。
控制台最低价能用于所有渠道和长请求吗?
不能。列表最低价对应具体渠道;详情页未展开的长上下文、缓存有效期和 Batch 条件,应另外确认,不自行按折扣补全。
从 Haiku 4.5 换到 5.5,费用一定降九成吗?
单价比例不能直接代表任务节省。新版分词方式改变 Token 数,思考、重试和请求跨档也会改变总费用;应重新测量同一任务的计费用量。
来源与延伸阅读
- Claude 官方 API 价格:标准价格、长上下文与 Batch 规则。
- Haiku 5.5 官方模型概览:规格、费率与默认思考方式。
- Claude 官方提示词缓存文档:写入、读取、有效期和 usage 字段。
- Haiku 5.5 官方迁移指南:分词变化、thinking 和输出解析。
- Haiku 5.5 升级、编程用途与迁移注意事项:判断是否适合当前任务。

