用 AI 清理重复名称:先建立合并候选,别把相似当成相同
一份商品目录里同时出现“纸舟白杯”“纸舟马克杯白色”和“纸舟白杯套装”,让 AI 统一名称似乎只需一句话。但名称相近可能是同款,也可能尺寸或包装不同。真正需要整理的是哪些记录指向同一件东西,而不只是把文字改得整齐。
AI生成概念配图
先约定你说的同一件是什么
OpenRefine 官方说明提醒,聚类主要寻找字符层面的相似,单靠它不足以判断语义上的同一实体。这个边界同样适合约束 AI:它提出候选关系,人根据业务字段确认。开始前先决定是在合并同一型号、同一规格,还是同一销售包装。
以虚构目录为例,甲是“纸舟白杯,三百五十毫升,单只”,乙是“纸舟马克杯白色,三百五十毫升,单只”,丙是“纸舟白杯,五百毫升,单只”,丁是“纸舟白杯,三百五十毫升,两只装”。若目录按销售规格管理,甲乙可以进入同组候选,丙丁必须保持独立。
用身份字段支持候选关系
给每行保留源编号,并提供品牌、容量、颜色、包装数量和已有商品编号。明确哪些字段必须一致,哪些允许别名。甲乙若具有相同的可靠商品编号,可进一步核对;若只有名称相近,最多标记“待确认”,不能让模型自行补上容量或假定套装数量。
输出不要只有一个新名字。让 AI 给出源编号、建议标准名、候选组、支持字段、冲突字段和缺失信息。比如甲乙的支持是品牌、容量、颜色、包装均一致;甲丙的容量不同应阻止合并。标准名称从既有规范或人工确认值选择,避免把模型偏好的叫法误当权威名称。
可复用模板与一次反例检查
可复用模板:请按以下实体定义与匹配规则整理记录,仅生成候选映射,不删除或覆盖原始值。每组列出支持证据、冲突和缺失字段;存在冲突时禁止合并,信息不足时保留待确认。不要用相似度分数代替身份依据。最后列出未匹配记录和可能误合并的反例,由我确认后生成正式映射表。
再加一行戊:“纸舟白杯,容量未知,单只”。它与甲、丙都很像,但不能因为“甲接近戊、戊接近丙”,就把三者连成一组。请 AI 对每个候选组重新检查必需字段是否互相矛盾,尤其检查缺失信息是否成了连接本来不同对象的桥。
先选一小组人工已确认的同款与不同款作校准,检查模型会在哪种名称变化上误判。若把容量冲突判为可以合并,应修改匹配规则并回查同类候选,而不只是手改这一行。确认标准改变时,旧结果也要按新规则重审,避免前后两批采用不同身份定义。
保留映射,比直接覆盖更容易复核
在副本上应用已经确认的映射,保留旧值、新值、源编号、确认人和规则版本。先核对行数、唯一标识数量与候选组大小,再抽查多对一关系。如果这里只是统一名称,行数通常不应变化;如果还要汇总库存,则另定聚合规则,不能顺手把重复行删除。
同时抽查被保留为不同对象的记录,避免只关注误合并而漏掉明显同款。新的证据可能推翻旧判断,所以映射应能撤回并追溯。真实人员、客户或机构记录还涉及身份与权限,不能仅凭姓名相似合并;少合并几条待核实项,往往比无法恢复的错误归并更容易处理。


