让 AI 比较资料标签:共同标签更多,为什么相似度反而更低

前天 3阅读

让AI从一批资料中找“最相似的一份”,往往会得到一个没有计算依据的排序。若任务只是比较标签,可以先选定一个简单指标,再让模型展示集合。这样既容易复算,也更容易发现指标与实际需求不一致的地方。

让 AI 比较资料标签:共同标签更多,为什么相似度反而更低

AI生成概念示意图:重叠圆与标签形状表示两份标签集合的共同部分与总体范围;不对应真实记录、模型测评或实际软件界面。

先固定标签的含义

以下资料和标签都是原创合成教学材料,不对应真实书目,也没有进行模型检索测评。目标资料T有四个标签:纸张、折叠、结构、展示。本轮只把完全一致的词当成同一标签,每份资料中的重复标签只计一次。

候选A有纸张、折叠、摄影、灯光四个标签;B有纸张、折叠、结构、木工、布料、陶土、编织、染色、装帧九个标签;C只有纸张、折叠两个标签。先把完整清单输入AI,别只给共同标签的数量。

可复制提示词:“按给定词表比较T与A、B、C。逐个列交集、并集及元素数量,计算交集数量除以并集数量,再排序。不得补标签、猜同义词或把重复词算多次。最后解释这个指标没有回答哪些问题。”

从集合本身复算数字

T与A的交集是纸张、折叠,共两个;并集是纸张、折叠、结构、展示、摄影、灯光,共六个,交并比为二除以六,约零点三三三。人工把纸条上的相同词叠在一起,就能独立检查两个数量。

T与B有三个共同标签,但并集有十个,交并比为三除以十,等于零点三。与C的交集有两个,并集仍为T的四个标签,因此交并比为二分之一。按这一指标,顺序是C、A、B。

如果只数共同标签,B的三个会超过A与C的两个;加入并集后,B大量额外主题会降低相似度。这不是计算矛盾,而是两个指标分别回答“重合多少”和“重合占整体多大比例”。

让AI做指标反例检查

请AI检查一个实际需求:“我要同时了解结构和展示,C是否最适合?”答案不能只引用第一名。C虽然交并比最高,却没有这两个标签;它比的是集合相似,不是对需求的完整覆盖,更不是内容质量。

人工可以另外列两项必须满足的主题,先筛出都包含它们的资料,再在剩余项中比较相似度。本例三个候选都缺少展示,因此正确结果是没有候选满足条件,而不是从三个不合格选项里硬选冠军。

再做一个边界试验:如果T和某候选都没有标签,交集和并集都为空,零除以零没有定义。应报告无法按当前公式计算,或者事先约定空集合规则,不能临时让AI填一个看起来友好的分数。

把语义判断留作另一层

真实资料里,“纸艺”和“纸张手作”可能接近,但是否合并需要有词表依据。可先让AI提出同义词候选,由人确认后统一映射,再重新计算;不要在不同资料上悄悄使用不同的合并标准。

标签也可能只是编辑者的简写。没有某个标签不必然代表正文完全没有相关内容,因此此处的筛选只能说明标签层面是否满足,关键材料仍要读原文。AI可以帮助定位段落,但不能用标签替代证据。

最后保存目标集合、词表版本、各交并集及公式。下一次新增标签导致排序变化时,就能追溯是哪一个输入改变了结果,而不是把变化误以为模型忽然理解得更好了。

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。