这个提示词用来做什么
事故或线上故障发生后,整理结构化复盘报告并推动改进。按时间线还原过程,区分直接原因与系统性原因,并给出可跟踪的改进项与负责人。说明故障经过与影响即可,可指定复盘的参与方。
提示词全文
请帮我把这次故障整理成一份结构化复盘报告。
故障描述:{用几句话描述发生了什么、影响范围与持续时间}
已有信息:{粘贴时间线日志、监控截图文字、相关代码或配置、讨论记录,越多越好}
## 报告结构
1. 概述:一句话总结故障影响(影响面、时长、用户可见表现)
2. 时间线:按时间顺序列出关键节点(事件发生 → 发现 → 定位 → 恢复 → 确认),每个节点注明时间、观察与操作
3. 根因分析:区分直接原因与深层原因,用「5 Whys」往下追一层;对尚未确认的假设明确标注「待验证」
4. 影响评估:受影响指标(错误率、延迟、流量、收益等)与恢复情况
5. 行动项:按「立即执行(一周内)/ 短期(一个月内)/ 长期」分类,每项写明负责人、预期效果与验收标准
6. 经验教训:用 2-3 句话说明同类问题如何避免再次发生
## 要求
只使用我提供的事实,禁止补充未发生的细节;时间、数字不确定时标注「待补」;结论要可执行,避免「加强监控」「提高意识」这类无验收标准的空话。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
输入一次接口超时故障的时间线与日志,输出含时间线、根因分析与分级行动项的复盘报告。
基本信息
- 分类:工程
- 标签:故障复盘 · Postmortem · 稳定性 · 工程实践
- 收录日期:2026-08-29
同类提示词
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- 提示词回归测试:用 12 个边界用例验证改动没有把别处改坏
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 给端侧场景做一张模型选型约束表,而不是对着排行榜挑
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线
- 把 agent 里的判断类调用拆出来做替换评估