用一组小测试改进 AI 回答:个人也能开始做评测
同一个任务,换一句提示词后,AI 的回答看起来更完整了。但它是否漏掉关键信息、补出了不存在的日期,单靠阅读一两个样例很难判断。为常用任务准备一组固定测试,可以让每次调整都有可比较的依据。
OpenAI 的评测最佳实践建议围绕具体任务设定目标,覆盖常见、边界和对抗样例,并结合人工判断校准自动评分。下面是一套适合小规模起步的操作方法;样本数量是教学建议,不代表统计上充分。
先把“好回答”写具体
假设任务是把会议记录整理成待办。先定义四项验收标准:任务内容符合原文;明确出现的负责人与时间被正确提取;缺失信息明确标注;输出格式能被后续程序读取。每项记录“通过”“失败”或“不适用”,失败时保留对应原文和说明。
例如,虚构记录写着:“评估迁移风险,负责人下次再定。”正确待办应保留“评估迁移风险”,负责人标为未定,截止日期标为未提供。把主持人填成负责人,或把下次开会时间填成截止日期,都应算事实错误。
先做一份小而有差异的题集
可以从二十条经过脱敏的记录开始:十二条覆盖日常情况,四条覆盖缺少负责人、相对日期含糊等边界情况,四条加入无关要求或伪装成指令的记录内容。每条都由人写下必需结果、允许变化的表达,以及不可接受的错误。
不要只收集自己觉得模型擅长的例子。如果线上经常遇到口语、缩写或多次改口,就让它们出现在测试里。另留一批未参与提示词修改的题目,作为最终复核集,避免不断调参后只适应手上的题。
AI 模型生成的概念插图:固定测试输入与验收标准,对比回答差异,并保留失败样例供回归检查。
比较时尽量只改变一个因素
固定输入、资料和评分规则,对比旧提示词与新提示词。先保持模型及其他配置一致,确认提示词变化的影响;要比较模型时,再单独更换模型。保存版本、运行日期和原始输出,重要样例重复运行,观察结果是否稳定。
人工评分时可以隐藏版本名称,打乱答案顺序,并允许“两者都不合格”。先看事实和遗漏,再看可读性,避免长答案或漂亮排版获得额外好感。两个版本各有得失时,记录具体错误类型,比给出一个模糊总分更有帮助。
自动评分也需要验收
字段是否齐全、JSON 是否可解析,可以用程序检查;语义是否忠于原文,需要人工或模型辅助判断。如果让另一个模型评分,应提供明确标准和少量已标注例子,并抽查它与人的分歧。评审模型本身也可能误判,不能把它的意见当作绝对真值。
最后分别报告各项通过情况、严重错误数量、耗时与成本。即使平均表现改善,只要出现不可接受的错误,也应先修复再使用。上线后,把新遇到的失败样例加入回归集;每次改提示词或模型,都重新跑一遍。
评测可以从一个小文件开始。只要题目贴近实际、标准足够清楚、失败能够复现,就能逐步回答一个实用问题:这次修改,究竟改善了什么,又带来了哪些新问题?
资料核对日期:2026 年 9 月 30 日。本文未运行模型对比实验,也不提供实测排名。


