钱大多烧在 I/O,不是思考
作者先算了一笔账:读 5 个文件回答一个关于某个方法的问题、照旁边二十个测试文件的模式生成新测试、开完会更新文档——几千 token 花出去,几乎没有推理。问题不在订阅费,而在把大量粗活喂给了严重“大材小用”的前沿模型。到 2028 年 AI 编码成本预计超过开发者平均年薪,已有四分之一的工程负责人每月为 token 支付 200–500 美元,高的超过 2000。
两个 mode 解决八成的浪费
解法是 Portal by Spotify 的 AiKA Modes:一种声明式 Agent,跑在临时运行时上(作者形容为“agents 版的 Lambda”)。你定义指令、选模型、设 temperature、挂 MCP 工具,其余交给平台,CLI 或 API 都能调用,可以设为团队公开或私有。
- bulk-reader:批量读文件并输出结构化要点,处理 Claude 原本要整读的大文件
- code-writer:按参考文件匹配既有模式生成测试、配置、类型桩等样板代码
worker 模型示例用 Gemini 2.5 Flash(可在 Portal 实例里换成任意已配置模型),关键指令是“只输出代码,不加解释、不套 markdown 围栏”——否则 Claude 还要解析多余输出。
让路由变成强制规则
第一版把路由规则写进 CLAUDE.md,靠 Claude 自觉执行,可被无视、每个项目还要复制一份。现在的实现是一个叫 shunt 的 Claude Code 插件,三层结构让降级很自然:PreToolUse 钩子在每次 Read 或 cat 大文件时直接拦截并指向 /bulk-reader;两个脚本封装 CLI 调用并把结果交给 worker 模型(文件不进 Claude 上下文);Skill 文件指导 Claude 何时、怎么调用。
效果与边界
对 Java monorepo 的四种场景测量,bulk-read 平均节省约 90% token;code-write 场景中生成的代码直接写盘,Claude 甚至看不到。作者也明确列出做不了的事:编辑不能委托(worker 摘要里没有可靠行号)、推理不能委托(worker 漏掉了一个隐蔽的线程安全 bug,Claude 拿到正确上下文后几秒就发现)、单次调用有 30 秒上限,大文件要拆批;每轮委托都有网络往返,低于默认 350 行阈值时反而得不偿失。
模型路由的本质,是把系统工程问题变成配置问题:不造基础设施,只描述想要什么。