把人工判断项目从自动评分里“摘出来”是可行的,前提是先给每个项目写清可观察的判定证据,再规定评分只能用于排序、不能用于结案。假设你正在清理一批旧内容:其中一部分页面仍有访问价值,但自动评分把它们标成低分,准备整批下线。此时不要让评分直接决定去留,而应让评分只负责把项目分组,人工只处理边界组。
自动评分擅长处理可量化、可重复、结果稳定的判断,例如格式是否完整、字段是否缺失、链接是否可访问。它不擅长处理需要权衡的判断,例如旧内容是否仍有用户需求、旧合作关系退出是否会带来连带影响、旧系统里某个模块是否还被下游依赖。把这些项目交给评分,问题不在于分数不准,而在于分数回答不了“值不值得保留”这个问题。
一个实用的分法是看判定依据能否写成一句可验证的话。能写成“标题为空”“返回状态异常”的,可以自动处理;只能写成“这篇内容对老用户仍有参考意义”“这个接口还有两个内部调用方”的,必须保留人工判断。后一类项目即使被评分,也只能把分数当作线索,不能当作结论。
假设某站点有一批三年前发布的说明页,自动评分给出低分,系统建议整批退出。人工介入后不逐页重判,而是先做三件事:查访问来源是否仍有站内入口、查页面内容是否被其他页面引用、查是否存在只有该页才有的操作说明。三项都不成立的,归入可退出组;任一项成立的,归入保留组;证据互相矛盾的,归入待查组。
这个动作的结果会直接改变下一步。如果待查组数量很少,就逐条人工确认;如果待查组占比很高,说明评分维度没有覆盖“被引用”和“唯一说明”这两类证据,应先补充判定字段,再重新分组,而不是硬着头皮逐条看。人工判断的价值在这里不是替代评分,而是发现评分漏掉了什么。
人工判断最容易被自动评分替代的时刻,是判断过程没有留下痕迹。只写“保留”或“退出”,下一次清理时无法复用,只能重新评一遍,久而久之又会退回“看分数决定”。因此每个保留或退出决定至少要记三项:判定依据、证据位置、复查条件。
复查条件尤其重要。它把一次人工判断变成有期限的判断,避免“当初保留过”变成永久豁免。当复查条件触发时,项目重新进入待查组,而不是继续沿用旧结论。
防止替代的关键不是取消评分,而是限定它的输出用途。可以让评分负责三件事:把项目排序、标出明显可自动处理的部分、提示异常值。让人工负责另外三件事:确认边界项目、记录判定依据、设定复查条件。两边的输出分开存放,评分结果不直接写入最终决定字段。
这样安排之后,判断一个项目是否被评分替代,有一个简单的检查方法:看最终决定字段里能否找到评分之外的依据。如果所有决定都能追溯到某条人工记录的证据,评分就只是辅助;如果决定字段里只有分数和阈值,说明人工判断已经被绕过了。这个检查不需要额外工具,只需要看记录本身。
旧系统或旧合作关系退出时,同样容易把“整体评分低”当成“全部无价值”。更稳妥的做法是先按依赖关系拆开:哪些部分还被其他系统调用,哪些部分只服务于已经退出的流程,哪些部分虽然不再调用但保存了无法重建的配置或说明。前两类可以按计划退出,第三类即使不再运行,也值得把内容迁移出来再退出。
迁移动作本身会影响后续判断。如果迁移后仍有人查询这些内容,说明保留判断成立,复查条件可以放宽;如果迁移后长期无人使用,复查条件触发,就可以进入下一轮退出。这个过程里,评分最多用来提示哪些部分优先检查,不能替人决定哪些内容值得迁移。
需要核对具体工具当前提供哪些字段、能否导出判定记录时,应以工具内实际可见的信息为准,不要依据旧教程或他人转述推断。工具的功能和入口可能变化,判断方法本身不依赖某个固定界面。
把人工判断项目从评分中分离出来,靠的不是更复杂的模型,而是更明确的证据、记录和复查条件。只要最终决定能追溯到评分之外的依据,自动评分就仍然是帮手,而不是替代者。