用大模型 API 开发应用,最困惑的往往是账单。这篇示例文章解释几个最基础的计费概念。

输入与输出分开计费

几乎所有厂商都按 token 计费,并且输入与输出单价不同。通常输出更贵,因为生成过程需要更多算力。写代码时尽量把指令写精简,能显著降低成本。

上下文长度乘以每轮请求

每次请求都会把历史对话一起发送,所以多轮对话的消耗会累积。常见误区是「聊得越多越贵」,其实贵的是每次重发历史。

缓存与批量接口

不少平台提供缓存命中优惠与批量接口折扣:

  • 长系统提示词命中缓存后价格大幅下降
  • 异步批量任务的价格通常比实时接口低一半左右

省钱的基本原则

  1. 减少无意义的上下文重发
  2. 简单任务用小模型
  3. 高频请求走批量或缓存

(本文为开源仓库示例文章,具体价格以各平台公示为准。)