先说清楚:什么任务适合交给决策模型

判断标准只有一条——这一步的输出是不是「从一组事先写好的答案里挑一个」。如果是,它就不需要模型会写文章,只需要它把每个候选的分数算准。把生成和选择混在一起,代价是你要为一段你并不需要的解释付钱,还要在事后从文字里把结论抠出来。

  • 适合:工单分诊、风控分级、审批分流、意图归类、模型路由
  • 不适合:需要给用户写一段话、需要跨多个系统多步执行、候选本身还没定下来
  • 半适合:候选超过三五个,或者需要连续做多次选择——这时要考虑成本与延迟,而不是只换个模型

第一步:把候选写成「互相排斥、加起来完整」的清单

决策模型的质量上限,在你写候选清单的那一刻就定了。最常见的失败不是模型不准,而是候选之间有重叠——用户的问题既能算「账单」也能算「技术支持」,于是概率被平分给两个都对的答案,阈值判定就失去意义。

  • 每条候选给一句可判定的定义,写清它「包含什么」而不是「像什么」
  • 确认没有遗漏项:真实数据里出现但清单里没有的情况,要单独给一个「其它 / 转人工」的出口
  • 候选的边界要在团队内部先吵清楚,再交给模型——这一步的争论是在替你省后面的返工
候选分不清,模型只会把模糊原样还给你,还附上一个看起来很专业的概率。

第二步:定阈值,先定「不确定怎么办」

概率输出的好处是你可以只让高置信的那部分自动流转,剩下的交给人。阈值不要凭感觉定:先拿一批历史数据跑一遍,看在不同阈值下「自动处理的比例」和「错分的比例」各自是多少,再选一个业务能接受的交点。

  • 高阈值:自动处理得少,但错得少,适合金额大、不可逆的分流
  • 低阈值:自动处理得多,错得也多,适合错了能改、影响小的场景
  • 无论阈值多高,都要有一条兜底路径:低置信、超时、候选都不到阈值时,明确地转人工,而不是硬选一个

第三步:把「决策」和「执行」分开上线

先只做分诊,不让它执行任何动作:模型给出候选与概率,系统记录下来,但实际动作仍然由原来的流程或人来做。跑一到两周,你会得到一份真实的对照数据——它和人分别做对了多少、在哪两类之间最容易混。这份数据比任何排行榜都有说服力,也是后面放开自动执行的依据。

等到错误率稳定、兜底路径被真实触发过几次之后,再按类别逐步放开自动执行:先放开错了能撤回的类别,最后才碰不可逆的那一类。这条顺序和所有权限放开一样——不是能不能做,而是出错了能不能退回来。