最新NDCG先约定收益再归一:同一排序,换一种标签解释就会换分数 检索系统给出一列结果以后,只知道“相关的排得更前”还不足以复现一个NDCG数值。相关等级要怎样变成收益、位置怎样折扣、理想榜单从哪些候选产生,以及并列分数如何处理,都会进入最终结果。下面固定三个文档,让每个约定都能单... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新Brier分数相同也要拆开看:校准、分辨率和事件本身各占哪一份 分类模型输出0.8时,含义应当比“最后判成正类”更丰富。Brier分数用概率与实际0/1结果之间的平方误差衡量这种预测,数值越低越好。一个总分却混合了概率是否可信、模型有没有区分不同风险,以及这批事件本来有多难猜。先... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
分类排序里的 AP 怎么算:别把阶梯加权换成梯形面积 同一批分类预测,两个评测脚本都说自己在算“PR曲线下面积”,数字却对不上。先别归因于浮点误差:一个可能计算非插值平均精确率AP,另一个把曲线点用直线连接后做梯形积分。把五条记录列出来,差别就能追到每一次阈值变化。 yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
用一组小测试改进 AI 回答:个人也能开始做评测 同一个任务,换一句提示词后,AI 的回答看起来更完整了。但它是否漏掉关键信息、补出了不存在的日期,单靠阅读一两个样例很难判断。为常用任务准备一组固定测试,可以让每次调整都有可比较的依据。OpenAI 的评测最佳实践建... yunqueblog/ AI分享/ 2026-09-30/ 9 阅读