为什么需要可观测

对话式应用排障可以“再问一次”,Agent 应用不行——工具调用十几步,哪一步传错了参数、哪个模型烧了最多 token,光靠业务日志很难拼出来。Langfuse 做的事情,是把一次任务里的所有大模型调用串成一条 trace,记录输入输出、模型名、token 数、成本与耗时。

接入成本很低

  • Python / JS SDK 几分钟接入,支持 OpenAI、Anthropic 等常用 SDK 自动埋点
  • 也可以先不写代码:Langfuse 提供 OpenAI 兼容代理,应用只改一行 base_url 就能开始记录
  • 自托管一条 docker compose 命令即可;数据量小可以用云版免费档

对团队的价值主要是三件事。第一,账单可解释:每个功能的 token 成本能按 trace 拆到具体调用。第二,回归可对比:上线前后跑同一批评测集,分数变化能关联到某次改动。第三,排障有证据:Agent 卡住时,能看到它实际调了哪个工具、工具返回了什么。

建议从“只记录不阻断”开始:先观察一周真实流量,再根据 trace 里暴露的问题设计评测用例,而不是一开始就堆一大堆规则。

可观测的意义不是多看一个面板,而是让每一次调用都能被复盘。