让 AI 协助制作代号文稿:同一个人要始终对应同一个标记

10-01 3阅读

想请 AI 分析文稿里的对话关系,却不需要它知道真实姓名时,可以先制作一份代号稿。任务并不是随手把名字涂掉,而是保留谁对谁说话的结构,同时减少无关身份信息。替换规则如果不稳定,模型可能把同一个人当成两个人。

让 AI 协助制作代号文稿:同一个人要始终对应同一个标记

AI概念配图,非真实界面

把替换准备留在本地

以下人物、机构和句子全部虚构,不涉及真实个人。原稿写着“林澄把借阅单交给周岸,老林随后致电周老师”。假设作者确认林澄与老林是同一人,周岸与周老师是同一人,那么可以分别采用人物甲、人物乙两个代号。

先在自己控制的文件里建立映射:林澄、老林对应人物甲;周岸、周老师对应人物乙。这份映射与代号稿分开放置,不随稿交给外部模型。让 AI 帮你设计规则时,用这种虚构片段示范就够了,没有必要先上传真实原稿再请求它替你保护信息。

别名关系应由了解原文的人确认。现实中两个同姓称呼未必是同一人,某个“老师”也可能指第三个人。未经确认的称呼标为“身份待核”,不要为了使文章顺畅而强行合并。这里需要保留的是关系事实,不是一个看起来整齐的人物表。

替换要能解释每一次变化

按较长、较具体的完整称呼先处理,再检查短称呼。若原稿同时含“林澄”和“林澄工作室”,直接先替换姓名,可能留下“人物甲工作室”,仍透露与机构的关系。机构是否也要替换,应在规则里单列,不能让替换顺序替你做决定。

本例完成后应是“人物甲把借阅单交给人物乙,人物甲随后致电人物乙”。两位人物各出现两次,对话方向没有改变。若把老林替换成人物丙,就会凭空多出一个角色;若都替换成“某人”,又丢失了谁向谁交付材料的关系。

只替换姓名也可能留下可识别的细节。例如极少见的职务、精确地点和特殊经历组合在一起,仍可能让熟悉的人猜到身份。先问这些细节是否影响这次分析;不影响的就省略,需要保留的可以概括,并在本地记录概括范围。

分开检查残留与含义

第一轮做机械检查:搜索原来的全名、昵称、邮箱片段及机构名,逐项确认是否残留。不要仅凭模型一句“已脱敏”验收。第二轮做语义检查:代词指向有没有变,人物数量是否保持,称谓透露的关系是否仍然是任务必需的。

再进行一段回填试验。在本地根据映射把代号换回规范姓名,检查事件关系是否与原稿一致。别名可能都回到全名,因此不要求逐字恢复原句;要求身份对应可追踪。若需要保留原始措辞,应另存不可覆盖的原稿,代号稿只作为工作副本。

可复用提示:请只使用我提供的虚构样本,帮我设计人物代号替换规则。区分已确认别名与待确认称呼,保证一人一码、同码不复用;列出长称呼、机构名、代词和间接身份线索的检查点。不要宣称已匿名,也不要要求我上传真实映射表。

代号不是匿名保证

ICO 的说明强调,假名化与匿名化不能混为一谈,能够借助附加信息对应回个人的数据仍有识别风险。本文只是文稿准备方法,不提供法律合规结论,也不意味着处理后的内容自动适合公开发布。实际能分享多少,还取决于内容和接收范围。

如果文稿本身讨论的是某人的健康、家庭或其他敏感经历,换一个名字不一定解决问题。可以进一步把任务缩小到完全虚构的结构示例,或采用符合所在组织要求的处理环境。不要把真实身份映射和代号稿同时送入同一段外部对话。

完成标准很具体:别名没有被拆开,不同人没有混成同一代号,必要关系没有丢失,待核项仍清楚可见。AI 擅长协助整理这些检查步骤,分享决定和对原文的理解仍要由持有材料的人负责。

参考资料

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。