当团队评估 AI 编码智能体的成本时,往往会仔细审视模型。但三项独立基准测试指向同一个结论:智能体框架——也就是引导模型完成任务的软件——可能同样重要,甚至更能决定账单。原因是每一轮推理都要重新携带上下文,提供商在每一轮都要处理大量相互重叠的文本,其中包含框架自带的系统提示词与工具说明。
差距有多大
- 6 月的基准测试:12 种配置通过 OpenRouter 跑相同的 12 个 Python 任务,每解决一项任务消耗的 Token 从 Aider(architect 模式)约 3500 个到 OpenClaw 的 29.2 万个;换到第二个模型后排名几乎不变,说明差异来自框架软件而非模型行为
- Composio:用 DeepSeek V4 Flash 比较 8 种框架完成 30 个企业工作流(Airtable、Gmail、Google Calendar、Sheets、GitHub、Slack、PostHog),240 次执行中 129 次成功;每次成功成本从 Pi Agent 的 0.028 美元到 Claude Code 的 0.195 美元
- Artificial Analysis:用 DeepSWE、Terminal-Bench v2.1 与 SWE-Atlas-QnA 共 326 项任务、每项运行三次取平均,持续发布框架与模型组合的单任务成本、token 用量与耗时
机制:启动税
6 月那项测试给这个现象起了名字——启动税。在提示词开始处理任何任务之前,框架就要先发送自己携带的负担:系统提示词、工具说明与环境设置,Aider 约 700 个 Token,OpenClaw 约 2.6 万个。问题在于它按轮重复支付:一个每轮至少携带 2.6 万 Token、持续 15 轮的框架,仅脚手架就消耗约 39 万个输入 Token。启动税乘以轮数,对每任务 Token 用量的预测 R² 在两个模型上均为 0.99。
这些数字该打多少折
Composio 自己披露了对照实验的局限:Pi 通过两个模型提供商运行时使用了不同的推理设置,Prime Agent 的 30 次运行中只有 24 次可以评分,因此不能称为严格控制单一变量的实验。方向可信,具体倍数需要拿自己的业务数据复核。
选框架要和选模型同等对待:预算里真正能砍的是脚手架,不是模型单价。