让 AI 对勘三份抄本:异读可以列清楚,原文却不能靠多数票决定

前天 3阅读

三份抄本读起来大同小异,让AI“合成最通顺的一版”会过早抹掉差异。对勘的第一份交付应是一张带出处的异文清单,告诉读者每份材料实际写了什么。本文用三段自写文字,不涉及真实古籍鉴定,也不让模型根据措辞猜年代。

让 AI 对勘三份抄本:异读可以列清楚,原文却不能靠多数票决定

AI模型生成的概念插图:三张文本页的对应位置被连在一起;不是实拍、真实文物或可辨读的抄本影像。

把底本和正确答案分开

甲:“雨后,青鸟停在东窗。客人收起旧伞,静静等船。”乙:“雨后,飞鸟停在东窗。客人收起伞,静静等船。”丙:“雨后,青鸟停在西窗。客人静静收起旧伞,等船。”输入已是确认过字形的文字,当前任务不含OCR。

指定甲为对照底本,只意味着用它定位差异,不意味着它最早或最好。TEI的校勘装置将一个异文位置、各个读法与见证文本联系起来;某读法被选作底文,与其他材料实际保留什么,是可以分别记录的。

示范清单要覆盖四种变化

第一处,句首“雨后”之后:甲、丙为“青鸟”,乙为“飞鸟”。第二处,“停在”之后:甲、乙为“东窗”,丙为“西窗”。第三处,“收起”后的物件:甲、丙为“旧伞”,乙为“伞”;这里只能说乙比甲少“旧”,不能从这个现象直接断定乙的抄手漏写。

第四处不是简单的一个错字。甲、乙把“静静”放在“等船”之前,丙放在“收起”之前。应记录两边位置与完整短语,说明修饰关系变化;若仅列“丙删去静静”,就丢了它在前面重新出现的事实。

一份可用条目包含位置锚点、甲读法、乙读法、丙读法、变化描述与待判断事项。先用文字条目就够了;需要转TEI时再选择编码方法,不必让初学者先手写整套XML。转码后还须用对应模式校验,标签长得像标准不代表有效。

用重建核验遗漏,再限制结论

人工检查时,从甲复制两份工作稿。按清单将青改飞并去掉旧,应逐字得到乙;把东改西,并将静静从等船前移到收起前,应得到丙。本文已用独立脚本重建并比较全部字符,标点也保持一致。若还差一个字,说明清单不完整或变更范围写错。

但重建成功不能决定“青鸟”是真本。两份材料相同,可能因为互相抄录,也可能独立保存同一读法;更通顺也可能来自后人润色。本例没有年代、来源或其他证据,所以不给祖本、传抄树和优劣排名。

可复制的提示词

“对勘以下甲乙丙三份已转录文本:[粘贴上面三段]。甲仅作位置底本。按可定位的词组列全部差异,逐一写明每个读法属于哪份材料,区分文字替换、相对少字与词语移位。特别检查静静的修饰对象。给出从甲重建乙丙的操作清单,不润色原句,不用多数票选择原文,不推断未知年代或亲缘。最后列仍需实物、版本来源等外部证据才能判断的问题。”

这类任务的价值在于保全差异。遇到真正的残页、涂改或无法辨认的位置,还要增加缺损与存疑标记;不能把“没写”“看不清”和“页面已经缺失”统一填成空字符串。

参考资料

TEI Guidelines:Critical Apparatus

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。