用户反馈一多就只剩“体验不好”?用 AI 建一份可复核的主题码本

10-01 3阅读

几十条反馈交给 AI,常会得到“提升体验、优化性能、完善功能”三个大筐。它们听起来合理,却不能告诉团队下一步调查哪里。更有用的任务是建立一份主题码本:为每个标签写清定义、纳入条件和排除条件,让别人能沿着原句检查分类是否站得住。

用户反馈一多就只剩“体验不好”?用 AI 建一份可复核的主题码本

AI生成概念配图

先把一句反馈拆成可判断的片段

英国政府用户研究指南建议先记录实际看到或听到的内容,再按相似主题整理,随后讨论发现与行动。本文把这一思路改造成 AI 辅助编码流程;模型给出的是候选分类,研究者仍负责解释。处理真实材料前,移除与问题无关的身份和联系方式,并确认所用工具适合接收这些内容。

虚构应用“纸舟笔记”收到三条反馈:甲说“保存很快,但我不知道它有没有同步”;乙说“我能找到导出入口,只是格式没有我要的”;丙说“每次找上周的笔记都要翻很久”。不要把乙归成入口难找,也不要把甲归成速度慢。每条原文保留编号,长句可拆成片段,但不能拆掉“但是”“已经”等改变含义的词。

用纳入与排除规则固定边界

第一版码本可以设三个主题:“状态不明确”收录无法确认当前结果的表达,排除明确抱怨耗时;“输出格式不足”收录格式缺少或不合要求,排除找不到导出位置;“历史内容定位困难”收录搜索、筛选或翻找问题,排除内容本身已丢失。标签名称应描述材料里的问题,不直接写成“增加红色提醒按钮”这类解决方案。

按这份规则,甲对应状态不明确,乙对应输出格式不足,丙对应历史内容定位困难。一条反馈若同时提到两个问题,可以多标签;一句“用起来总觉得怪怪的”则进入待澄清,不能为了填满分类而自动解释成界面难看。

先校准少量样本,再扩大范围

先选十条包含明确、模糊和跨主题表达的样本,让人和 AI 分别归类,再逐条比较分歧。分歧可能来自定义重叠、片段拆分不当,也可能是信息不足。修改码本时记录版本及理由,并回查受影响的旧条目,避免前半批与后半批采用不同标准。

可复用模板:以下是带编号的反馈和主题码本。请逐片段给出候选主题、支持该主题的原句、适用规则及疑点。允许多标签与待澄清;不推断用户身份、动机或未提到的功能。遇到现有定义无法容纳的材料,提出新增主题建议,先不要合并进正式统计。最后列出最需要人工复核的条目及原因。

统计出现次数,不冒充总体比例

假设一份虚构材料中有二十条反馈,八条提到状态不明确,可以报告“本次材料中八条提及”,不能直接写成“四成用户都需要同步提示”。反馈渠道可能偏向主动投诉者,同一人也可能提交多次。还要说明计数单位是人、反馈还是片段;多标签合计超过总条数并不一定是错误。

交付时附上主题定义、原句编号、反例和待澄清清单。抽查高频主题,也抽查被模型留空和只出现一次的内容,避免少数重要问题被平均掉。归类最终要帮助提出可验证的问题,例如“用户通过什么判断同步完成”,而不是把模型生成的整齐标题当成已经证实的产品结论。

参考资料

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。