它是什么

9 月 24 日,Fastino 发布 GLiNER2.5-Decide。它的定位写得很直白:一个「专项分类器」,用于把文字分到运营判断上——客户与银行意图、差旅与门诊请求、评论情感、文档类型、邮件与工单路由、转人工、agent 完成度、内容审核、严重程度、紧急度、垃圾信息。传文本加一套你定义的标签,它在一次前向里给出结构化答案;单标签任务返回一个字符串,多标签任务返回所有超过阈值的标签,一次调用还能同时算多个头。

官方同时强调它「不是什么」,这几句比宣传语更有参考价值:不推理、不解释、不回答开放问题,也没有在公开榜单上训练,不能当通用模型用。

规格与成绩

  • 编码器 DeBERTa-v3-large,340M 参数,Apache-2.0,pip install gliner2 后用 AutoExtractor.from_pretrained 装载,可跑在 CPU、GPU 或断网环境。
  • 官方自建的 fast-decisions 测试集:17 个领域、每个领域 300 条留出样本,文本与候选标签完全一致,平均准确率 60.1%。同口径下 1B 的 GLiNER2.5-Decide-1B 为 59.6%,4B 生成式基线 SemIf(Qwen3.5-4B)为 56.4%,同尺寸编码器 Laya(ModernBERT,421M)为 46.6%。
  • 延迟:48 核 Xeon CPU 上 p50 167.3 毫秒;NVIDIA T4 上 64 tokens 输入 43.6 毫秒。
  • 同日还发了两款兄弟模型:GLiNER2.5-Decide-1B 与面向多语言输入的 GLiNER2.5-multi-Decide。

一个具体的省钱场景

第三方分析给了一个很好算的例子:一个四个人的客服工具团队,每月有几十万张工单,每张都要调一次前沿模型,只为了决定「该分给谁」。换成 340M 模型后它跑在你已经租着的 Web 服务器上,纯 CPU 约 167 毫秒返回,Apache-2.0 不需要任何人审批。把一周的真实工单同时过两个方案,比较标签一致率,就能判断能不能换。

该验证什么

  1. 用自己的数据交叉验证。60.1% 来自厂商自建测试集,不能当作你的准确率,只能当作「值得试一次」的理由。
  2. 把边界写进架构。它不解释、不生成,所以它只能做判断节点,不能做兜底对话;不确定的样本要有一个明确的升级出口。
  3. 把阈值和标签集当成配置来管。标签集在调用时传入意味着改口径不需要重训,但也意味着标签定义混乱会直接反映成结果漂移。
分类和路由这类高频结构化判断,本来就不需要生成能力——把它从大模型账单里摘出来,是这个模型最实际的意义。