用模型给图片打一个「美学分」,再按分数排序,这件事现在很容易做到。难的是判断这个分数值不值得信。

结论先说:它能用来粗筛,不能用来定标准。

这类分数是怎么来的

主流做法是用一批人类偏好标注训练一个预测模型,让它学会「人更喜欢哪张」。所以它学的不是美学理论,而是标注人群的平均偏好。

这句话决定了它的全部特性:它反映的是标注群体的口味,不是你的标准,也不是绝对质量。

能用在哪

  • 批量粗筛。把明显不合格的图剔掉,减少人工看图的量。
  • 训练集清洗。剔除严重失真的样本,提升整体稳定度。
  • 排序参考。给人工挑选提供一个初始顺序。

这三个用法的共同点是:最终决定权还在人手里,分数只负责把工作量降下来。

不能用在哪

用法问题
当唯一标准分数高但内容错的图会被放行
跨风格比较写实与插画不在同一尺度上,比出来的结果没有意义
判断正确性美学分不反映结构错误、文字乱码、肢体异常

第二点最容易踩。把不同风格的图混在一起排序,得到的往往是「哪种风格更符合标注人群口味」,而不是「哪张更好」。

三个已知偏差

  1. 构图偏好。偏向主体居中、留白规律、对比明显的构图,对刻意的非对称构图不友好。
  2. 亮度偏好。整体偏亮、饱和度适中的图容易被高估。
  3. 风格偏斜。训练数据的风格分布会直接传导到分数上。

第三条意味着:如果你的目标风格在训练分布里占比低,分数会系统性低估你的好图。

自建校准

把通用美学分校准成自己的标准
  1. 1抽样从自己的图库里随机抽 200 张,覆盖各风格与质量档
  2. 2人工打标按自己的标准分三到五档,不看模型分数
  3. 3比对画出人工档位与模型分数的分布,找偏差区间
  4. 4定阈值按用途设不同的分档线,例如粗筛线与精选线分开
  5. 5复校每季度重抽一批,检查阈值是否漂移

第三步是重点。如果发现模型分数和人工档位在某个区间大量冲突,说明那一类图不适合用分数决策,需要单独处理。

结论

美学分是一个廉价的工作量过滤器。它的价值在于「便宜且够用」,而不在于「准确」。

把它放在流程的前段,用它降低人工量;不要把它放在末端,用它做最终判断。

分数和人工判断冲突时怎么办

冲突无法完全消除,能做的只有分类处理:

  • 分数低但人工选中。检查是不是风格偏离了训练分布,如果是,这类图单独走人工通道。
  • 分数高但人工淘汰。检查是不是内容有硬伤,比如结构错误或文字乱码,这类错误分数本来就不该负责。
  • 两档之间大量交叉。说明阈值切得不对,需要按用途重新分档,而不是调高调低。

第二种情况最能说明问题:美学分只回答好不好看,不回答对不对。把两件事分开,冲突就少了一半。

最后提醒一点:任何打分模型都会随着时间和数据分布漂移。定期重抽样本复校,是让它继续可用的最低成本手段。不校准的分数,几个月后就会变成噪音。

另外,这类模型给不出「为什么这张分低」,所以不要拿它当沟通依据。跟设计师解释的时候,给示例比给分数有效得多。


免责声明:本文为技术方法讨论,所述结论基于个人实践与公开资料,不构成任何产品或采购建议。