用 AI 比较两种分类办法:同一批样本怎样换边
资料库更换分类办法后,某类从六篇增加到七篇,很容易被概括为“多了一篇”。但总数只显示净变化,可能同时有内容移入和移出。让 AI 比较两种分类时,先保住每份材料的身份,再看它在两套规则下分别落在哪里。
AI生成概念示意图:同一组卡片在不同分类中的位置变化,图中数量不代表正文数据。
先冻结同一批材料
以下十二篇手作说明及其判断结果均为虚构练习,编号为一至十二。旧办法只看是否列有明确步骤,将一至六号记为“可上手”,七至十二号记为“需补背景”。它很容易执行,但没有检查步骤是否依赖未说明的准备知识。
新办法要求材料、前置知识和操作入口都交代清楚,才能标为可上手。人工重新阅读同一版本后,一至五号仍可上手,六号改为需补背景,七、八号转为可上手,九至十二号仍需补背景。新办法下可上手共七篇,需补背景五篇。
两套标签名字一样,判断标准却发生了变化,因此不能把新旧结果直接解释成材料质量进步。比较期间不修改正文、不新增材料、不删除编号。否则分类规则的影响会与内容更新混在一起,无法从结果中拆开。
四个交叉格把变化讲清楚
以旧类别为行、新类别为列,可得到四格:旧可上手且新可上手五篇,旧可上手但新需补背景一篇,旧需补背景但新可上手两篇,两边都需补背景四篇。四格相加为十二,行合计六和六,列合计七和五。
真正变更标签的是六、七、八号,共三篇;保留标签的是其余九篇。两篇移入可上手、一篇移出,所以净增一篇。若只看六变七,就会遗漏那篇被移出的材料,也无法给负责维护的人列出正确的处理清单。
让 AI 在每格后保留编号,不能只输出汇总数字。第一格是一至五号,第二格是六号,第三格是七、八号,第四格是九至十二号。每个编号应出现一次且仅一次,空格要明确写零,不要删除整格改变表的含义。
沿着迁移样本查规则
六号虽然有分步列表,却要求使用一份未附上的折线模板;按新办法,它缺少实际起点。七、八号没有编号步骤,但连续图注已写明材料和动作,因此在这次人工判断中满足新办法。例子说明的是标准变化,并非有序列表天然更好或更差。
这三条迁移记录应附上具体依据,而不是只写“模型重新判断”。如果七号有一句图注读不清,就暂列待确认,不要为了凑齐七篇而假定它完整。待确认项需要单独统计,并说明当前交叉计数还没有覆盖全部材料。
可复用提示:请按固定编号对齐两份分类结果,保留旧标签、新标签和对应规则版本。输出四格交叉计数及每格编号,再列标签变化项,核对行列总数和编号唯一性。缺失、重复或待确认先报告,不合并、不补标签,不把净变化当作迁移总数。
人工检查要从编号开始
抽出六号,回到它的原文确认缺失模板;再查七、八号,确认新判断的依据确实存在。随后把十二个编号逐个划掉,检查是否有一份材料被不同标题重复录入。模型可能把改过标题的同一篇当成两篇,导致总数刚好对上却身份错配。
这份交叉表没有外部标准答案,所以九篇标签一致只能称为一致数量,不能叫准确率。更不能用它证明新办法更有效。若想知道哪种分类更方便读者,还需要另行观察他们能否找到并完成目标操作。
最后交付两样东西:全体材料的对照表,以及三条需要维护的变化记录。这样“只多一篇”的表面结果,才能还原成真正发生的移动,也让后续复查知道应该回到哪份原文、哪一版规则。


