用一组小测试改进 AI 回答:个人也能开始做评测 同一个任务,换一句提示词后,AI 的回答看起来更完整了。但它是否漏掉关键信息、补出了不存在的日期,单靠阅读一两个样例很难判断。为常用任务准备一组固定测试,可以让每次调整都有可比较的依据。OpenAI 的评测最佳实践建... yunqueblog/ AI分享/ 2026-09-30/ 9 阅读
让 AI 文档问答更可核查:把结论连回原文 把说明书、会议记录或项目资料交给 AI,最有用的结果往往是:回答问题,同时告诉读者结论从哪里来、适用到什么范围。这样遇到疑问时,我们可以直接检查原文,而不是继续询问模型“你确定吗”。先整理资料的身份开始问答前,为每份... yunqueblog/ AI分享/ 2026-09-30/ 8 阅读
让 AI 稳定输出 JSON:从提示词到可校验的数据 把 AI 用在聊天里,少一个字段还能追问;接进自动化流程后,同一个问题就可能让整批任务中断。做工单分类、信息提取或表格整理时,先定义数据契约,会比反复补一句“请严格按格式回答”更容易维护。先分清两层约束JSON 模式... yunqueblog/ AI分享/ 2026-09-30/ 13 阅读