Agent 从 Demo 到可用,差距主要在三个地方:记忆会不会丢、工具接得稳不稳、多步任务错了能不能自己恢复。
记忆分层
- 短期:当前任务的对话上下文,控制长度防止漂移
- 工作记忆:任务中间产物(文件、变量、计划)结构化存储
- 长期:向量库存经验与偏好,跨会话复用
工具设计原则
- 一个工具只做一件事,参数明确,错误信息友好
- 返回结构化结果(JSON),减少模型解析负担
- 关键操作(删除、付款、发布)加人工确认开关
- 工具描述写清楚「什么时候用、什么时候别用」
多步任务设计
- 任务分解:把大目标拆成可验证的子步骤
- 检查点:每步记录中间结果,失败可回退重试
- 自我反思:让模型在关键节点总结进度与偏差
- 兜底:超过重试次数转人工,别无限循环
判断 Agent 是否可用,不是看它成功一次,而是看它失败后能不能自己纠正。