自动评分可以替你排序,但不能替你判断。防止人工判断项被顶掉的关键,不是关掉评分,而是把“只有人能判”的项目从评分模型里单独拎出来,给它一条独立于分数的处理路径。
评分模型擅长处理可量化、可重复、边界清晰的对象,比如页面是否返回正常状态、标题长度是否落在设定区间、内链数量是否达到阈值。这些项目交给自动评分,效率高且一致性好。
但有几类项目天然不适合被单一分数替代:内容是否真正回答了搜索意图、两个近义选题是否构成重复、某条外链所在页面是否与主题相关、某段表述是否存在事实风险。这些判断依赖语境和业务背景,分数只能作为线索,不能作为结论。
区分方法很简单:问一句“如果分数很高但人工看后认为不对,谁说了算”。如果答案是人工,这项就不该被自动评分直接决定去留。
面对人工判断项,通常有两种看似合理的做法。
做法一:全量自动评分,再对低分项人工复核。适合评分维度已经稳定、误判率低、人工资源有限的团队。代价是高分项里混入的错误不会被发现,人工判断实际上被分数顺序绑架——人只看低分,高分区域成了自动评分的自留地。
做法二:先按项目类型分流,人工判断项不进入评分排序,直接进入人工队列。适合内容风险高、业务语境强、评分模型尚未经过验证的团队。代价是人工工作量上升,且需要明确哪些项属于“人工判断项”,否则分流规则会不断膨胀。
选择依据不是哪个更先进,而是看误判的代价落在哪一侧。如果漏掉一个错误判断的代价远高于多花人工时间,就选做法二;如果评分模型已经过历史数据校验、误判主要集中在低分区间,做法一可以接受,但必须保留对高分项的随机抽检。
具体动作可以分三步。
这个动作的直接结果是:人工判断项不再因为分数高而被跳过,也不再因为分数低而被误杀。下一步可以根据人工队列的实际处理量,决定是否收窄或放宽“需人工判”的标签范围。
假设有一批待评估页面,其中一页标题长度、关键词覆盖、内链数量都落在评分模型的优区间,自动得分很高;但人工阅读后发现它只是把多个相近问题拼在一起,没有真正回答其中任何一个。
在做法一下,这页因为高分进入“通过”区域,不会被人工看到,问题被保留。在做法二下,它先被标记为“需人工判”,分数只作参考,人工复核后进入修改队列。两种路径的差别不在评分准不准,而在于人工判断有没有机会介入。
这个例子说明:自动评分衡量的是可量化特征,人工判断衡量的是这些特征组合起来是否成立。两者不能互相替代,只能分工。
并非所有人工判断项都必须永久人工。当某一类判断经过足够多的人工复核,且复核结论与评分结果的一致性稳定,可以考虑把这类项目降级为“可评分加抽检”。
但降级需要满足条件:判断标准已经被写成可执行的规则,且规则能覆盖绝大多数情况;误判的代价可控,不会造成事实错误或合规风险。对于涉及事实准确性、品牌表述、法律边界的项目,即使评分一致性很高,也应保留人工终审。
另外要注意,人工队列积压本身不是把项目推回自动评分的理由。积压说明分流规则过宽或人工资源不足,应该调整规则或补充人力,而不是让人工判断项重新被分数决定。
出现这些信号时,先检查分流规则和人工队列的排序依据,而不是直接调高或调低评分权重。评分权重解决的是排序问题,解决不了“该不该由人来判”的问题。
把人工判断项从评分排序中拿出来,给它独立的队列和明确的标签标准,自动评分就回到它该在的位置:提供线索,而不是替人做决定。