让 AI 拆开总体成功率:每组都更好,合起来为什么反而落后

10-01 4阅读

看见两份操作指引的完成率,一个是百分之六十五,一个是百分之七十五,很容易直接选后者。但如果两份指引面对的任务难度不同,这个排名可能同时包含指引差异与任务构成差异。AI 可以帮助拆开账目,判断比较究竟回答了什么。

让 AI 拆开总体成功率:每组都更好,合起来为什么反而落后

AI生成概念示意图:不同构成的样本进入比较;图中筹码不对应实际数据,不是现场照片或软件界面。

先保留分组里的成功数和总数

以下成人手作活动、甲乙指引和全部数字均为虚构教学材料。任务只有简单、复杂两类,“成功”统一定义为在规定步骤内完成检查。这里只演示统计关系,没有进行真实活动,也没有测试任何模型。

使用甲指引的简单任务十次,成功九次;复杂任务五十次,成功三十次。使用乙指引的简单任务五十次,成功四十次;复杂任务十次,成功五次。请 AI 原样抄出四组分子与分母,再计算比例。

简单任务中甲为百分之九十,乙为百分之八十;复杂任务中甲为百分之六十,乙为百分之五十。甲在两组都高十个百分点。不过甲合计成功三十九次、共六十次,乙合计成功四十五次、共六十次。

因此总体确实是甲百分之六十五、乙百分之七十五。计算没有矛盾:甲接到更多复杂任务,乙接到更多简单任务。总体比例给两类任务分配了不同权重,不能只看两条分组比较就猜它的方向。

给两份指引使用同一套权重

如果下一场预计简单与复杂任务各占一半,可以要求 AI 用这个共同构成重算。甲为九十与六十的平均,即百分之七十五;乙为八十与五十的平均,即百分之六十五。此时甲高十个百分点。

这两个数是按指定构成算出的比较值,并非刚才六十次记录的实际总体完成率。正文应同时写明“原记录总体”与“按各半构成计算”,不能把后一个结果替换进历史记录,造成实际发生过的错觉。

也可以把简单任务占比改成四分之一,复杂任务占四分之三。甲得到百分之六十七点五,乙得到百分之五十七点五。共同权重改变了两个水平,却没有改变这个例子里甲领先十个百分点的差值。

请 AI 解释原因,而不只报答案:两组原本都相差十个百分点,使用相同且总和为一的权重后,差值仍为十个百分点。人工可以用纸笔分别加权一次,确认没有把成功次数直接平均。

相同构成也没有自动证明原因

按难度分组只处理了已经写出的这一项差别。如果人员经验、材料批次或完成时限仍不相同,就不能从这组记录断言更换指引必然提高表现。这里的例子证明一种算术可能性,没有证明真实干预效果。

让 AI 单列需要核对的条件:难度分类是否一致,成功定义是否改变,未完成记录是否被漏掉。它可以指出缺少哪类材料,不能补造参与者特征,也不能用“已控制其他因素”掩盖资料不足。

若某类任务没有观察记录,就把对应结果留空。不能为了凑齐两组而借用另一类比例,也不能将零次观察写成零成功率。缺少分母与观察到全部失败,是两件不同的事。

把结论写回使用场景

一个合格的摘要可以是:原记录中乙的总体完成率更高;在简单和复杂任务内,甲的完成率均更高;采用各半任务构成时,甲的加权比较值更高。三句话分别对应三种明确计算。

最后保留原始计数、分组比例、共同权重和加权结果四项。AI 负责整理计算路径与检查措辞,人负责确认数据来源、分类含义以及下一场的真实构成。这样的比较才有可追问的依据。

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。