大模型 API 通常按「输入 Token 数 + 输出 Token 数」分别计价,部分厂商对缓存命中、夜间调用提供折扣。输出 Token 通常比输入贵 2~4 倍。
影响价格的因素
- 模型档次:旗舰模型价格远高于 mini/轻量档
- 上下文长度:输入越长费用越高,超长上下文档位单价更高
- 推理模型:思考过程也计费,实际成本可能是普通模型的数倍
- 缓存:启用上下文缓存可大幅降低重复内容成本
选型策略
- 先用便宜模型验证流程,再用旗舰模型优化关键环节(两层架构)
- 高频简单任务固定用 mini/轻量档;复杂推理任务单独走推理模型
- 把公共知识通过 RAG 注入,减少重复长输入,降低输入费用
- 以官网价格页为准,各厂商(OpenAI、Anthropic、Google、DeepSeek、通义等)页面都公开 Token 单价