注意:LLM API 的定价变化非常频繁。本文中的价格信息为 2026 年 7 月的参考值,实际使用前请查看各厂商官网的最新定价页面。

计价方式

LLM API 按 token 计费。核心规则:输入 token 和输出 token 分别计价,输出通常更贵。

各家都提供不同档位的模型——旗舰模型能力强但贵,轻量模型便宜但够用。了解价格结构比记住具体数字更重要,因为价格几乎每个月都在变。

容易被忽略的成本

上下文长度影响费用。 如果你在每次请求中附带了 10 轮历史对话,这 10 轮对话的 token 都会计入输入费用。一个聊天机器人如果不对历史做截断,月账单上”输入费用”往往远超预期。

输出 token 默认值过高。 很多 API 默认 max_tokens 设得很高。如果只需要一段简短回复,可以显式限制 max_tokens。

流的费用和普通请求一样。 streaming 只是改变传输方式,不改变 token 消耗。

不同供应商计价差异悬殊。 同等质量的服务,价格可能差 10 倍以上。原因包括自研芯片 vs 采购 GPU、是否自建数据中心、商业策略等。

省钱策略

  1. 分级路由:分类/提取/摘要等预处理任务用轻量模型,最终生成用强模型
  2. 缓存常见结果:相同或相似的问题直接返回缓存,不调 API
  3. 限制 max_tokens:根据任务实际需要设定上限
  4. 定期审计用量:每周看一眼 API dashboard,异常消耗通常来自一个没注意到的配置错误

本文写于 2026 年 7 月。API 定价是高频变动信息,请以各厂商官网为准。