大模型 API 通常按「输入 Token 数 + 输出 Token 数」分别计价,部分厂商对缓存命中、夜间调用提供折扣。输出 Token 通常比输入贵 2~4 倍。

影响价格的因素

  • 模型档次:旗舰模型价格远高于 mini/轻量档
  • 上下文长度:输入越长费用越高,超长上下文档位单价更高
  • 推理模型:思考过程也计费,实际成本可能是普通模型的数倍
  • 缓存:启用上下文缓存可大幅降低重复内容成本

选型策略

  • 先用便宜模型验证流程,再用旗舰模型优化关键环节(两层架构)
  • 高频简单任务固定用 mini/轻量档;复杂推理任务单独走推理模型
  • 把公共知识通过 RAG 注入,减少重复长输入,降低输入费用
  • 以官网价格页为准,各厂商(OpenAI、Anthropic、Google、DeepSeek、通义等)页面都公开 Token 单价