DeepSeek V4.1 Flash API 价格与接入:缓存计费、峰谷时段和旧模型迁移

按当前官方资料说明 DeepSeek V4.1 Flash 的模型 ID、人民币峰谷价格、缓存命中计费和首次接入,区分旧 Flash 别名、V4 Pro 与平台渠道规则。

40 分钟阅读
DeepSeek V4.1 Flash API 价格与接入:缓存计费、峰谷时段和旧模型迁移

接入 DeepSeek V4.1 Flash,官方模型 ID 使用 deepseek-flash。先选清楚官方直连还是第三方平台,再使用对应平台签发的 API Key 和接口地址。费用按缓存命中输入、未命中输入、输出分别计算;官方还区分高峰和空闲时段。

DeepSeek 中文官方价格中,空闲时段每百万 Tokens 的未命中输入为 1 元、输出为 4 元,缓存命中输入为 0.02 元;高峰时段三项均翻倍。已有旧 Flash 接入的团队,还要检查别名实际指向及思考模式的工具循环。

本文核验于 2026 年 10 月 9 日,依据 DeepSeek 官方价格、首次调用、缓存、思考模式和更新日志,以及 AICodeWith 当前页面与文档。费用案例为假设计算,请求代码未进行本站付费调用;不声称实测速度、质量或生产稳定性。

DeepSeek V4.1 Flash 应该填哪个模型名

deepseek-flash 是官方当前推荐的 API 名称,对应 DeepSeek-V4.1-Flash。它支持文本与图像理解、工具调用,并提供 OpenAI Chat Completions、Responses 和 Anthropic 兼容接口。官方当前列明 1M 上下文、最大 384K 输出;容量不等于赠送额度。

官方 API 名称当前对应关系新接入建议
deepseek-flashDeepSeek-V4.1-Flash使用这个正式名称
deepseek-v4-flash旧模型已下线,兼容路由到 V4.1 Flash更新为正式名称并做回归
deepseek-v4-flash-vision-exp旧实验模型已下线,兼容路由到 V4.1 Flash不再将其当成独立旧模型
deepseek-v4-pro官方仍提供 DeepSeek-V4-Pro-0813不能当作 Flash 的同义名

这些映射来自 官方模型与价格及 更新日志。它们适用于官方 API,不自动适用于每家中转站。

DeepSeek 早期公布过下线 V4 Pro 的计划,随后在更新日志中明确:9 月 14 日后继续提供 Pro,计费方式不变。预算和迁移应依据当前价格页与更新记录,不能只沿用首发新闻中的下线时间。

官方 API 当前怎样收费

以下为 DeepSeek 中文官方直连价格,单位是人民币元 / 百万 Tokens。输出是计费输出量,包括适用的推理输出,不只指屏幕上可见的答案。

计费项目空闲时段高峰时段
缓存命中输入¥0.02¥0.04
缓存未命中输入¥1.00¥2.00
输出¥4.00¥8.00

费用公式是:未命中输入量 ÷ 1,000,000 × 未命中单价 + 命中输入量 ÷ 1,000,000 × 命中单价 + 计费输出量 ÷ 1,000,000 × 输出单价。

这里按官方列出的命中与未命中输入收费,不套用 Claude 的独立缓存写入有效期价格。第三方渠道、税费、外部工具和重试费用另外核对。

峰谷时段怎样按北京时间判断

官方当前规则以北京时间列出:周一至周五、不含中国法定节假日,09:00–12:00、14:00–18:00 为高峰;其余时段,包括周末与法定节假日全天,均为空闲时段。

北京时间情景适用时段
非节假日周一上午 10:00高峰
非节假日周一中午 13:00空闲
非节假日周一下午 16:00高峰
周末或中国法定节假日空闲

部署在海外的定时任务需要先换算到北京时间,不按服务器当地时区判断。跨越价格边界的长请求按哪个时点结算,本文未从当前说明中确认,应核对实际账单或服务合同,不自行假设按开始或结束时间。

一次调用花多少,缓存能改变多少费用

假设一次请求有 20,000 个输入 Tokens、2,000 个计费输出 Tokens,无重试和额外工具费:

输入构成空闲时段高峰时段
20K 全部未命中缓存¥0.028¥0.056
18K 命中 + 2K 未命中¥0.01036¥0.02072

第一行空闲费用为 0.02 × ¥1 + 0.002 × ¥4 = ¥0.028。第二行是 0.018 × ¥0.02 + 0.002 × ¥1 + 0.002 × ¥4 = ¥0.01036。

如果 1,000 次请求都符合第一行情景,空闲与高峰总额分别为 28 元和 56 元;如果全部符合第二行,分别为 10.36 元和 20.72 元。它们是固定计费用量的预算案例,不是某类任务必然具有的缓存命中率。

缓存为什么不一定在第二次请求就命中

官方上下文硬盘缓存默认开启,开发者无需使用 Claude 风格的 cache_control 设置。但命中需要已有缓存前缀单元与后续请求完整匹配,系统尽力提供缓存,不保证每次成功。

可以用前缀关系理解:第一次发送 A+B,第二次发送 A+B+C,可以复用已保存的 A+B;如果第二次换为 A+C,并没有完整匹配 A+B。系统可能识别共同前缀 A 并将其保存,第三次 A+D 才能复用 A。具体规则见 官方缓存文档。

资料内容、系统指令和工具定义需要重复时,尽量保持稳定前缀,把变化的问题放在后面。核对返回的 usage.prompt_cache_hit_tokens 和 usage.prompt_cache_miss_tokens,以实际字段判断,而不是只看两次问题是否相似。

命中输入已经按命中价计算,不要再把相同 Tokens 乘未命中单价。输出仍独立计费;缓存被清理或前缀改变后,重新按实际未命中用量计算。

官方直连与平台接入分别用什么地址

先把服务方、Key 与协议配成一组。DeepSeek 官方 Key 与第三方平台 Key 不是同一凭据,也不扣同一账户余额。

路线Base URLKey 来源本文示例协议
DeepSeek 官方https://api.deepseek.comDeepSeek 开放平台OpenAI Chat Completions
AICodeWithhttps://api.aicodewith.ai/v1AICodeWith 控制台OpenAI Chat Completions

官方另有 Anthropic 兼容入口 https://api.deepseek.com/anthropic。AICodeWith 文档则将 DeepSeek 放在 OpenAI 兼容入口下;不要把两家服务的地址拼接规则混用。官方首次调用说明、AICodeWith API 概览

先用一个不带工具的请求跑通接入

在对应服务方创建 Key,并通过自己的凭据管理方式设置环境变量 MODEL_API_KEY。下面选择官方直连;若改用 AICodeWith,必须同时换成其 Key,并将 MODEL_BASE_URL 设为 https://api.aicodewith.ai/v1。

MODEL_BASE_URL="https://api.deepseek.com"
curl -sS "${MODEL_BASE_URL}/chat/completions" -H "Authorization: Bearer ${MODEL_API_KEY}" -H "Content-Type: application/json" --data '{ "model": "deepseek-flash", "messages": [{"role": "user", "content": "请用一句话解释缓存命中输入与普通输入的计费区别。"}], "thinking": {"type": "disabled"}, "max_tokens": 1024, "stream": false }'

代码依据官方 Chat Completions 与思考模式参数编写,未在本文中付费执行;平台地址依据当前接入文档,渠道功能仍需在实际账户中验证。使用非思考、不带工具的短请求,是为了先验证鉴权、路径、模型与文本响应,再扩展 Agent 功能。

成功检查包括:没有 API 错误对象,choices[0].message.content 中有正常回答,usage 有计费用量,服务方后台有对应请求记录。核对返回的模型字段与平台路由信息,不用模型回答“我是谁”来证明实际模型身份。如果 finish_reason 表示长度截断,重新检查输出预算。

按错误类型排查,不要同时乱改配置

错误或现象优先检查
官方 HTTP 401Key 是否属于该服务,是否完整、有效
官方 HTTP 402对应账户余额,不能拿另一平台余额判断
HTTP 404 或 model not found地址、请求路径、准确 ID 与渠道开放情况
官方 HTTP 400 / 422请求格式、参数、历史消息或工具循环
官方 HTTP 429官方限流说明,降低并发并设置有上限的重试
官方 HTTP 500 / 503服务错误或繁忙,受控重试并保存错误信息

401、402、400、422、429、500 和 503 的含义参考 官方错误码。平台可能有自己的错误文本;404 是路径或模型排查建议,不能视为官方错误码表对所有网关的统一定义。

思考模式与工具循环需要改哪些地方

官方思考模式默认开启,默认 effort 为 high,实际思考档位为 low、high、max。Chat Completions 使用 thinking.type 开关和 reasoning_effort;不同协议的字段并不相同。

在 OpenAI SDK 中,官方要求把 thinking 放进 extra_body。原始 HTTP 请求中则直接放在 JSON 请求体。先根据所选协议核对字段,不把 Claude 的 adaptive thinking 参数照搬进 DeepSeek 请求。

迁移 Agent 时最重要的是 reasoning_content:请求带有 tools 后,后续请求需要完整回传历史 reasoning_content,即使某一轮没有实际调用工具。没有 tools 的普通对话则不需要回传;官方会忽略这部分历史推理内容。官方思考模式指南

思考模式下,temperature 等部分参数即使传入也不会生效。调试时记录真实的开关、档位、工具调用和用量,不能把“请求未报错”当成所有参数都已生效。

平台渠道价格和官方峰谷价怎样核对

通过支持多个模型的 API 中转站使用 DeepSeek 时,需要确认实际渠道。下面是 AICodeWith 的 deepseek-flash 详情在核验日显示的数字,单位标记为美元 / 百万 Tokens;它们是页面展示记录,不是本文验证的结算价:

渠道输入展示价输出展示价缓存读取展示价缓存写入展示价
战略算力资源(5.2 折)$1.04$4.16$0.0208$0
第三方厂商(7.5 折)$1.50$6.00$0.0300$0
官方直连$2.00$8.00$0.0400$0

同日公开模型页把 V4.1 Flash 的输入、输出、缓存读取列为 ¥2、¥8、¥0.04,而控制台详情显示相同数字但标记为美元。两处币种标记不一致,因此本文不把控制台这组数字当作人民币费率,不按自行设定的汇率换算,也不据此计算平台实际省钱比例。正式预算应确认账户扣费币种和对应渠道结算规则。

另外,官方峰谷时段不自动适用于每条中转渠道;渠道名称“官方直连”也不能替代账单合同。核对真实调用的渠道、时间、输入命中与未命中、输出和扣费金额,再确认折扣及时段规则。

旧模型迁移怎样确认没有改错路线

官方旧 Flash 别名虽然仍可调用,但已经由 V4.1 Flash 服务。更新配置中的模型名后,同步检查客户端 allowlist、监控标签、预算规则和工具循环,避免配置写了新名却仍请求旧条目。

官方 V4 Pro 仍是独立路线。本站旧 Pro 条目的简介仍提及“下线后路由到 Flash”,不能用这段简介推断官方已经下线,也不能据此确认本站此刻实际路由。需要使用平台模型目录、调用记录或服务方说明核对。

选择一项已复现的代码问题或资料提取任务,保留原来的输入、工具、权限和验收标准,再用新 ID 回归。检查回答依据、工具结果、是否遗漏约束、所有请求费用与人工修正。兼容别名保持请求成功,不等于底层行为与旧模型相同。

结论

新接入使用 deepseek-flash,先用短请求验证 Key、地址、模型与返回内容,再扩展思考和工具调用。官方预算按北京时间峰谷规则,以及命中输入、未命中输入和输出分别计算。

迁移时区分旧 Flash 的兼容映射与仍在提供的 V4 Pro。通过平台调用,则额外核对渠道与扣费币种;本文的官方人民币算例不能替代平台账单。

常见问题

DeepSeek V4.1 Flash 是免费模型吗?

官方 API 按用量收费,免费聊天产品或活动额度不等于所有 API 请求免费。官方说明同时有充值和赠送余额时优先扣赠送余额,但不代表每个账户都有赠送额度。

周末调用一定是空闲价吗?

核验时的官方规则把北京时间周末列为空闲时段。第三方渠道是否采用相同规则,需要核对其合同与账单。

第二次发送相似资料就一定命中缓存吗?

不一定。缓存需要完整匹配已保存的前缀单元,构建也需要时间,官方不保证 100% 命中。以 usage 中的命中与未命中字段为准。

deepseek-v4-pro 已经变成 Flash 了吗?

官方当前没有。更新日志明确继续提供 Pro;旧 Flash 名称兼容到 V4.1 Flash 是另一项变更。中转平台的实际映射需另行确认。

控制台标价与公开页币种不同,应该用哪一份算?

先确认账户实际结算币种、渠道和时段规则,再用核实后的单价计算。本文记录两处显示差异,不自行认定标记错误或替平台补充换汇合同。

来源与延伸阅读