用 AI 核对筛选结果:误收一条和漏掉一条,代价可能不同
让 AI 帮忙筛选资料后,最容易汇报的是“多少条分对了”。但被误收的无关资料会占用复核时间,被漏掉的相关资料可能再也没进入阅读清单。验收之前,需要先说清这两种错误分别意味着什么。
AI生成概念示意图:进入筛选容器的项目与留在外面的项目;图形只表达分类关系,不是模型实测结果或软件界面。
先建立独立于预测的参考答案
以下资料卡、筛选规则和预测数字均为虚构练习。共有一百张卡片,按照事先确定的专题定义,二十张相关、八十张无关。这份人工确认的参考分类在本例中称为真值,模型输出称为预测。
真值不能来自“AI 自己说分得对”。实际任务要由能读懂材料的人按同一标准标注;遇到争议先讨论专题边界,再进入评估。把未判定卡片硬塞进无关组,会让后面的数字看似完整,含义却变了。
设宽松方案选入二十八张,其中十六张相关、十二张无关;未选入七十二张,其中四张相关、六十八张无关。请 AI 把四个格子分别写成命中、误收、漏收、正确排除,并回算相关总数为二十。
用两个问题分别评价筛选
第一个问题是“选进来的有多少能用”。本例为十六除以二十八,约百分之五十七点一四。这通常称为精确率,分母是所有选入项。十二张误收卡片会降低这个比例。
第二个问题是“真正相关的找回了多少”。本例为十六除以二十,即百分之八十,通常称为召回率,分母是所有相关项。四张漏收卡片影响的是这一项,两种比例不能混用名称。
总体正确率则是十六加六十八,再除以一百,得到百分之八十四。它把命中与正确排除合在一起,无法单独告诉你漏掉了几张关键材料。先展示四格计数,读者才能理解每个比例。
收紧规则之后,再计算任务代价
现在假设另一个严格方案只选入十六张,其中十二张相关、四张无关。于是漏收八张,正确排除七十六张。精确率升到百分之七十五,召回率降到百分之六十,总体正确率升到百分之八十八。
这组数字只是一种可能结果,不代表所有筛选器调整阈值都会按这个幅度变化。若实际工具没有可调分数,就把两种明确的筛选规则分别评估,不能凭空声称调整了某个模型阈值。
假定任务负责人事先约定:误收一张记一个处理代价单位,漏收一张记五个单位。宽松方案为十二加四乘五,合计三十二;严格方案为四加八乘五,合计四十四。按这个约定,严格方案反而更贵。
若漏收只记一个单位,两者代价就分别变成十六和十二。代价权重来自任务目标,不是准确率公式自动给出的事实;这些单位也不是实际费用或工时,不能写成已节约了多少钱。
让验收结果保留可改变的地方
请 AI 输出四格计数、两个比例、总体正确率和代价算式,并标出使用的权重。人工应抽查原卡片与真值的对应,独立复算分母,再确认漏收与误收的权重是否反映实际工作。
还有一种可选安排:把边界不清的卡片留给人复核。但此时必须报告自动选入、自动排除和待复核各有多少,不能把尚未判断的部分当作自动筛选成功。复核能力也会限制这种安排是否可用。
当规则用于另一批资料时,相关卡片的占比可能改变,旧比例不能保证原样延续。AI 能把验收关系解释清楚,是否采用某种规则,仍要回到新材料、可接受错误与人工复核能力上决定。


