大模型 API 的费用差异,往往不只来自模型选择,还取决于请求是否实时、上下文能否复用,以及任务被安排在什么时段。对于翻译、数据标注和离线分析等非即时工作,调整调用方式就可能显著降低成本。接下来将从批处理、缓存和错峰计费入手,拆解具体策略及其适用边界。
关于大模型省钱,最常见的误区是:想省钱就得换更差的模型。其实同样是调 API,有人每月花几百块,有人花几十块效果差不多。差别不在用的模型,在 "什么时候用、怎么用"。
本文先把目前主流的折扣机制讲清楚(数字附官方出处),再给三套分人群的实操策略,最后从平台运营视角拆一层:错峰和批量定价,平台侧到底是怎么设计出来的。
一、先认清一件事:API 定价不是固定的
大多数人调用大模型是 "想到就用":打开对话框问一句,或者代码里直接调 API。但同样的模型能力,在不同时间、不同调用方式下,价格可能差出一倍甚至更多。
这有点像打车:高峰期和深夜不是一个价,拼车和专车不是一个价。大模型服务也是这样,只是价格藏在产品条款和 API 文档里,不主动找很难发现。
省钱不是让你换更差的模型,而是在合适的时间、用合适的方式,调用同样的能力。
二、目前主流的五种折扣机制
先给结论:最该优先做的是 Batch API 和缓存命中,这两项是官方明码标价的折扣,不抢时段、不拼手气。
折扣:OpenAI、Anthropic 均 50% off
代价:结果延迟,最长 24h 返回
适合:数据标注、批量翻译、离线分析
OpenAI 官方定价页写明:通过 Batch API 异步运行任务(24 小时内返回),输入输出各省 50%。Anthropic 的 Message Batches API 同样打五折,官方文档原话是 "compared to standard API prices 50% discount",输入、输出、特殊 token 都适用。
一个容易被忽略的细节:OpenAI 的 batch 折扣不设最小量门槛,单行 JSONL 的请求也按 50% 计。
折扣:OpenAI 缓存输入约为基础输入 10%;Anthropic 命中读取 0.1×
代价:需要固定重复前缀,首次写入有加价
适合:长 system prompt、模板化批量调用
大模型计费的大头在输入(prefill)阶段。各家都在对 "重复的部分" 降价:
OpenAI:GPT-5.5 输入 5/百万token,缓存命中5/百万 token,缓存命中 5/百万token,缓存命中0.5,便宜 90%;GPT-5.4 mini 同理(0.75→0.75 → 0.75→0.075)
Anthropic:缓存写入 5 分钟 TTL 加价 25%(1.25×),1 小时 TTL 加价到 2×;命中读取只要 0.1×(Claude Opus 系列命中价 0.5vs基础0.5 vs 基础 0.5vs基础5)
DeepSeek:V4.1 Flash 缓存命中输入 0.02 元 vs 未命中 1 元,只有 2%
实践要点:把固定内容(system prompt、公共文档、Few-shot 样本)放在前缀,保持每次请求的前缀一致,重复部分自动命中缓存。
折扣:DeepSeek 闲时 = 高峰半价,周末全天闲时价
代价:任务要挪到闲时时段
适合:不紧急的批量、离线处理
DeepSeek 从 2026 年 8 月 17 日起实行峰谷计费:工作日北京时间 9:00-12:00、14:00-18:00 为高峰,其余时间为闲时,闲时价格是高峰的一半;8 月 23 日起,周末两天全天按闲时价计费。
以 V4.1 Flash 为例,同一模型:闲时缓存命中输入 0.02 元 / 百万 token,高峰未命中输入 2 元 —— 一次调用,100 倍价差。
折扣:通常比月付省 20%-40%
代价:一次锁一年
适合:已验证工作流、确定长期用
传统玩法,不多说。年付的前提是你确定长期用。
折扣:约为按需价 1/3 到 1/5
代价:随时可能被回收
适合:能接受中断的自部署
自部署开源模型时,云 GPU 竞价实例可能只有按需价的 1/3 到 1/5,代价是实例可能被随时回收。适合有技术能力、能接受中断的开发者。
三、三种人群怎么实操
个人用户:把不急的事挪到便宜时段
长文写作、翻译、资料整理,安排到批量任务或闲时时段
年付前算一笔账:月付 × 12 vs 年付,差价是否值得锁定
别同时订多个功能重叠的工具,按实际使用频率取舍
开发者:三层叠加
第一层:能用 Batch 的绝不用实时 API—— 直接五折
第二层:批量任务再挪到闲时时段 —— 部分平台可再降(如 DeepSeek 闲时半价)
第三层:开启缓存命中 —— 重复前缀按基础价 10% 计
算一笔账(输入侧):标准输入价 1 元 → Batch 五折 = 0.5 元 → 缓存命中再一折 = 0.05 元。输入成本降到标准价的 5%。输出不受缓存影响,但可以走 Batch 打五折。
(注:以上是叠加口径,具体数字以各平台当期定价表为准。)
小团队 / 企业:混合策略 实时交互任务:全价 API,保证体验
批处理任务:Batch + 错峰,压缩成本
敏感数据:本地部署开源模型,省 API 费用也避免数据外泄
预算坚控:设置用量告警,防止月底失控
四、避坑
以下情况别省钱,老老实实走实时全价:
用户等待的实时对话
时效性强的数据(新闻摘要、实时坚控)
对结果顺序有严格要求的任务
折扣时段的隐性成本:
响应变慢,可能拖慢下游流程
部分平台闲时限流更严,超了会被限流
折扣档可能不支持某些高级功能
原则就一条:核心业务用全价,边缘任务走折扣。
五、成本优化清单
优化步骤如下:
盘点当前所有 AI 支出:订阅 + API,按月统计
区分任务类型:实时 vs 批量,核心 vs 边缘
批量任务迁移到 Batch API
非紧急任务安排到错峰时段
检查是否有重复订阅,砍掉低频工具
长期工具评估年付是否划算
开发场景开启缓存命中(固定前缀结构)
设置用量告警,防止意外超支
每季度复盘一次:价格变了没?用量结构变了没?
六、延伸:平台侧怎么设计错峰与批量定价
下面这部分,以我们做聚合 API 平台的一线视角展开。错峰、批量、缓存这些折扣,用户在消费侧看到的是 "省钱",平台侧要回答的是:让利之后还能不能转前,以及怎么定价才不会伤害实时业务。
6.1 为什么值得做:算力利用率的账
GPU 是重资产。白天高峰算力紧张,夜里大量闲置。错峰和批量定价的本质,是把闲置算力用低价换出去:用户省了钱,平台把 GPU 利用率提上来,两边都划算。
前提是成本模型算得清。闲时 GPU 的边际成本确实低,让利空间是真实存在的,不是拍脑袋打折。让利幅度一旦超过边际成本,折扣就变成了亏损,这是平台侧的第一道红线。
6.2 时段定价:时段怎么划、按什么计
DeepSeek 的做法可以直接借鉴:
时段划分:工作日按北京时间 9-12、14-18 划高峰,其余为闲时;周末全天闲时价
折扣幅度:闲时 = 高峰半价
计费锚点:按 "服务端收到请求的时间" 计费,不是按返回时间
最后这条很关键。如果按请求完成时间计费,用户会想办法把实时请求 "拖" 到闲时结算,定价体系就乱了。按接收时间计费,规则简单,争议也少。
设计要点:
时段要和目标用户的作息匹配。做 To B 批处理生意的,真正的 "高峰" 是批处理任务集中的时段,不一定是自然时间意义上的白天
先小范围灰度再全量,别一上来把整个价格体系打乱
条款里写清楚计费锚点,前端明示当前是峰是谷
6.3 Batch 产品:SLA 和通道隔离
Batch 的 50% 折扣,换的是 "确定性":
SLA 要明确:OpenAI 的批量 SLA 是 24 小时内完成。不承诺 SLA 的批量等于没保障
通道隔离:batch 队列不能挤占实时通道的算力。否则批量任务跑起来,实时用户开始投诉延迟,省下的钱不够赔口碑
门槛越低,用户越容易迁移:OpenAI 单行 JSONL 也享受 50%,这个策略很聪明 —— 先用低门槛把用户拉进来,再用任务量说话
结果轮询和错误重试:批量任务要提供清晰的轮询接口和失败重试机制,让用户敢把核心流程交过来
6.4 缓存定价:把 "重复" 变成 "折扣"
Anthropic 的缓存定价模型值得直接借鉴:
写入加价:5 分钟 TTL 的缓存写入 1.25×,1 小时 TTL 2×—— 用户为 "存储" 付费
命中降价:读取只要 0.1×—— 用户为 "重复使用" 省钱
TTL 分档:5 分钟适合短会话,1 小时适合长任务,按场景给档位
平台侧落地的关键,是帮用户把 "可缓存前缀" 结构化:固定 system prompt、公共文档、Few-shot 样本放前面,变化部分放后面。缓存命中率越高,用户越愿意留下来,算力成本也越低 —— 这个双向受益。
6.5 套餐怎么和时段结合
做聚合平台这几年,我们观察到套餐和时段结合有两条路线:
闲时额度包:基础档全时段可用,加购 "时段流量包" 给批量用户
档位分层:按模型档次(旗舰 / 经济)和调用方式(实时 / 批量)拆成不同档位,让用户按自己的调用结构选
我们的取舍是:套餐设计的第一原则是可预期。折扣和时段规则越多,用户越算不清,越不敢充值。所以套餐内的折扣要简单(一个百分比、一个时段),复杂的让利放在 API 计费层做,别塞进套餐里。
6.6 平台侧的风险与边界
收入波动:折扣让利要有成本模型支撑,定期核算折扣后有一定的毛利,
实时业务保护:batch 和闲时流量绝不能和实时通道抢资源,架构上要物理隔离
用户教育:折扣条款要透明,写明限流规则、最低消费、SLA。把 "折扣" 做成 "陷阱",用户会用脚投票
套利坚控:平台侧同样要盯坚控 —— 有没有人把实时任务包装成 batch 提交、有没有人在闲时时段批量囤积再转售
模型能力越来越同质化之后,的合理性会成为新的竞争力。对用户,把 "不急的事" 挪到便宜时段,是零成本的省钱方式;对平台,错峰、批量、缓存这三个,是把闲置算力变成收入的三条路。
附:本文事实来源
OpenAI 官方定价页:Batch API 50% off、缓存输入价格(openai.com/pricing)
Anthropic 官方文档:Message Batches API 50% off、Prompt Caching 定价倍率(docs.claude.com)
DeepSeek 官方定价文档:峰谷时段划分与 V4.1 Flash 价格(api-docs.deepseek.com)
北京商报、广州日报等媒体关于 DeepSeek 峰谷计费生效及周末调整的报道
价格随时可能调整,文中数字截至 2026 年 9 月,实际以各平台官方定价页为准