四项更新分别是什么

  • LangSmith Engine v2:在平台内自动做 agent 开发各环节的工作,新增红队测试、扩展的问题检测,以及自动化的修复验证。官方数据是 Engine 自 5 月上线以来已协助分析了 6000 万条以上轨迹、诊断出数万个问题。
  • Managed Deep Agents v0.8:新增用户级记忆,把调用者相关上下文与 agent 级共享记忆分开存放;内置网页搜索作为预置工具(由 Parallel 提供),不需要另外申请厂商账号或 API key。
  • LangSmith Trajectories:把一次 agent 会话里人、AI 与工具的消息按时间顺序聚合成对话视图,主 agent 与子 agent 的消息合并呈现,用来快速看清行为从哪一步开始变化或出问题。
  • LangSmith Fine-Tuning:支持对开源模型做监督微调,用生产轨迹构造训练数据,目标是在专项任务上用小模型替代通用前沿模型,换取更低成本与延迟。

为什么这组更新值得单独看

过去一年 agent 平台的竞争集中在「能不能跑起来」,而真正卡住落地的是另一件事:跑起来之后怎么知道它为什么失败,以及怎么把已经跑通的部分固化下来。这四项更新恰好各回答一半——Engine v2 与 Trajectories 负责让失败可见,Fine-Tuning 与用户级记忆负责把成功沉淀成能力。

落地时的顺序建议

  1. 先做可观测性,不要先做微调。没有轨迹视图就不知道失败样本长什么样,微调会变成盲目试参数。
  2. 把「用户级记忆」当成数据治理问题处理。它意味着同一 agent 对不同用户行为不同,隔离范围、保留期限与删除方式要在上线前写清楚。
  3. 微调用在稳定的专项任务上。只有当某个任务的输入分布稳定、标签可自动构造时,用生产轨迹做微调才有意义;探索性任务用它反而会锁死行为。
  4. 内置网页搜索降低了接入门槛,但要明确它与自建检索的边界——预置工具方便,代价是检索策略与数据源受制于别人。
让失败可见、把成功沉淀——agent 平台的竞争已经从「能不能跑」转到「跑完能不能学到东西」。