用模型给图片打一个「美学分」,再按分数排序,这件事现在很容易做到。难的是判断这个分数值不值得信。
结论先说:它能用来粗筛,不能用来定标准。
这类分数是怎么来的
主流做法是用一批人类偏好标注训练一个预测模型,让它学会「人更喜欢哪张」。所以它学的不是美学理论,而是标注人群的平均偏好。
这句话决定了它的全部特性:它反映的是标注群体的口味,不是你的标准,也不是绝对质量。
能用在哪
- 批量粗筛。把明显不合格的图剔掉,减少人工看图的量。
- 训练集清洗。剔除严重失真的样本,提升整体稳定度。
- 排序参考。给人工挑选提供一个初始顺序。
这三个用法的共同点是:最终决定权还在人手里,分数只负责把工作量降下来。
不能用在哪
| 用法 | 问题 |
|---|---|
| 当唯一标准 | 分数高但内容错的图会被放行 |
| 跨风格比较 | 写实与插画不在同一尺度上,比出来的结果没有意义 |
| 判断正确性 | 美学分不反映结构错误、文字乱码、肢体异常 |
第二点最容易踩。把不同风格的图混在一起排序,得到的往往是「哪种风格更符合标注人群口味」,而不是「哪张更好」。
三个已知偏差
- 构图偏好。偏向主体居中、留白规律、对比明显的构图,对刻意的非对称构图不友好。
- 亮度偏好。整体偏亮、饱和度适中的图容易被高估。
- 风格偏斜。训练数据的风格分布会直接传导到分数上。
第三条意味着:如果你的目标风格在训练分布里占比低,分数会系统性低估你的好图。
自建校准
把通用美学分校准成自己的标准
- 1抽样从自己的图库里随机抽 200 张,覆盖各风格与质量档
- 2人工打标按自己的标准分三到五档,不看模型分数
- 3比对画出人工档位与模型分数的分布,找偏差区间
- 4定阈值按用途设不同的分档线,例如粗筛线与精选线分开
- 5复校每季度重抽一批,检查阈值是否漂移
第三步是重点。如果发现模型分数和人工档位在某个区间大量冲突,说明那一类图不适合用分数决策,需要单独处理。
结论
美学分是一个廉价的工作量过滤器。它的价值在于「便宜且够用」,而不在于「准确」。
把它放在流程的前段,用它降低人工量;不要把它放在末端,用它做最终判断。
分数和人工判断冲突时怎么办
冲突无法完全消除,能做的只有分类处理:
- 分数低但人工选中。检查是不是风格偏离了训练分布,如果是,这类图单独走人工通道。
- 分数高但人工淘汰。检查是不是内容有硬伤,比如结构错误或文字乱码,这类错误分数本来就不该负责。
- 两档之间大量交叉。说明阈值切得不对,需要按用途重新分档,而不是调高调低。
第二种情况最能说明问题:美学分只回答好不好看,不回答对不对。把两件事分开,冲突就少了一半。
最后提醒一点:任何打分模型都会随着时间和数据分布漂移。定期重抽样本复校,是让它继续可用的最低成本手段。不校准的分数,几个月后就会变成噪音。
另外,这类模型给不出「为什么这张分低」,所以不要拿它当沟通依据。跟设计师解释的时候,给示例比给分数有效得多。
免责声明:本文为技术方法讨论,所述结论基于个人实践与公开资料,不构成任何产品或采购建议。