防止自动评分替代人工判断,不是完全关掉评分,而是把评分降级为排序信号,把保留、改写、退出这三类决定留给人工。具体做法是:先找出评分与人工结论分歧最大的样本,判断分歧来自数据缺口、口径错位还是场景例外,再决定这个评分项是保留、改写还是退出。
自动评分替代人工判断,通常不是某一次算错,而是评分项和业务目标之间出现了系统性偏差。要发现它,不能只看平均分,而要看评分与人工结论不一致的样本集中在哪。
一个可操作的起点:从最近一批结果里抽二十到三十条,人工按实际可用程度排序,再和评分排序对照。如果高分样本里混进了明显不能用的结果,说明评分把某个容易量化的特征当成了主要依据;如果低分样本里藏着可用的结果,说明评分漏掉了只有人工才看得懂的语境。
这一步的产出不是新阈值,而是一张分歧清单。清单上每条记录要写清:人工判断是什么、评分给出什么、分歧可能来自哪里。只有先分清分歧类型,后面的保留、改写、退出才有依据。
评分项值得保留,通常满足一个条件:它挡掉的结果,人工也会挡掉,而且人工不必逐条看。也就是说,评分和人工在“明显不可用”这一区间高度一致。
判断方法可以这样设计:把评分最低的一批结果单独拿出来,人工快速过一遍,统计其中有多少是你本来就会排除的。如果绝大多数都该排除,这个评分项就还在承担过滤作用,适合保留。
保留不等于放任。保留的同时要给它划出作用范围,例如只用于初筛,不用于最终取舍。这样评分继续省人力,但不会替人做决定。
适用前提:评分项与人工在低价值区间一致,且业务对漏掉少量边缘结果不敏感。如果业务要求“宁可多留不可错杀”,这个前提就不成立。
更常见的情况是评分方向没错,但权重把次要特征抬得太高,或者统计口径和实际使用场景对不上。这时退出整个评分项会浪费已有信号,改写更合适。
改写可以从三个位置入手:
改写后要重新做一次小样本对照,确认分歧清单上的条目是否减少。如果分歧没减少,说明问题不在权重,而在评分项本身选错了特征,应转向退出。
假设例子:某评分把结果长度作为质量代理,短结果普遍低分。人工复核发现,短结果里有一部分恰好更直接可用。此时可把长度从主评分降为参考项,而不是直接删掉评分体系。这个例子只说明比较方法,不代表任何具体工具的现有行为。
当某个评分项反复把人工认为可用的结果压到低位,或者反复把不可用结果推到高位,且改写权重后仍无改善,就应退出。退出的标志不是评分变低,而是人工纠正它的频率没有下降。
退出时要区分两种处理:
退出后要观察人工复核的工作量变化。如果工作量没有明显上升,说明这个评分项原本就在制造额外纠正;如果工作量大幅上升,说明它仍在承担隐性过滤,应回到改写而不是退出。
注意,请求量、抓取量或某项统计归零,不能单独证明退出正确。归零也可能来自采集范围变化、去重规则调整或上游数据缺失。要结合人工复核记录一起看。
防止自动评分替代人工判断,最终靠的是留下可复查的人工结论。没有记录,人工判断只存在于个人经验里,下次仍会被评分牵着走。
记录至少包含三样:判断对象、人工结论、判断依据。依据要写到别人能复核的程度,例如“该结果偏离目标场景,因为示例中的条件与业务前提不符”,而不是只写“感觉不行”。
当分歧清单积累到一定数量,就可以反过来检查评分项:哪些分歧反复出现,哪些只出现一次。反复出现的分歧指向评分项的稳定缺陷,应优先改写或退出;一次性的分歧可能只是样本噪声,不必立刻改动评分体系。
这套流程的取舍很清楚:保留评分用于省人力,改写评分用于修正方向,退出评分用于停止持续纠错。三者不是同时全做,而是根据分歧清单的证据选一个先动。