用 AI 核对重要性采样:权重再归一一次,估计为什么反而出现偏差
离线评估或概率推断中,手里的样本可能来自q,关心的平均值却属于p。重要性采样用p/q补偿来源差异,但普通加权平均与“把权重再归一到一”是两种估计量。自归一常有实用价值,却不能据此声称有限样本完全无偏。
AI生成的概念示意图:不同来源比例需要配合权重解释;珠子数量与圆环面积不对应正文概率,也不是实测数据。
先区分目标分布与抽样分布
教学世界只有A、B两种记录。目标p给A概率0.8、B概率0.2,采样器q却各给0.5。令f(A)=0、f(B)=1,因此目标平均值为0.8×0+0.2×1=0.2。两种分布已知,所有样本独立有放回地来自q。
比值权重w(A)=0.8/0.5=1.6,w(B)=0.2/0.5=0.4。普通重要性估计把每条w×f相加,再除以样本数n。自归一估计使用同一个分子,却改为除以本次抽到的权重总和。
两条样本,把所有情况列完
抽两条时,AA、AB、BA、BB四种有序结果各有1/4概率。普通估计依次为0、0.2、0.2、0.4;四种结果的平均是0.2,等于目标平均值。无偏指这种重复抽样意义下的平均正确,不是每次都恰好等于0.2。
自归一估计遇到AA时为0;AB和BA时,分子0.4、权重和2,结果仍为0.2;BB时分子0.8、权重和0.8,结果变成1。四种结果平均为(0+0.2+0.2+1)/4=0.35,出现向上的有限样本偏差0.15。
这不是权重算错了,而是随机分子除以随机分母一般不能用“分子期望除以分母期望”代替。BB恰好只看见值为1的记录,自归一平均就只能是1;普通估计仍保留了这类记录在目标分布中的较小权重。
为什么仍有人选择自归一形式
如果只知道p乘了一个未知的正常数,两边权重都会带同一个因子。自归一分子分母相除时,这个未知因子能够消掉;普通形式却不能直接恢复正确尺度。它也总在已观察f值的最小与最大之间,这在解释结果时有时方便。
在合适的支持集和可积条件下,样本增加时自归一估计可趋向目标值,但“一致”与“任意有限n都无偏”不是同一句话。本文没有假定它的方差一定更小;事实上这个两样本例子的普通估计方差为0.02,自归一估计方差为0.1475。
让AI输出抽样表,而不只交最后一个数
提示词可以写:“给定p、q、f与n,枚举所有样本序列及其q概率;逐项列权重、分子、两个分母、两种估计;最后对估计再求抽样期望和方差。”本次独立程序使用有理数运算,验证0.2、0.35及上述两项方差,避免随机模拟波动遮住差异。
若某种目标记录p大于零,却在q中概率为零,样本永远见不到它,权重不能补出不存在的证据。若q虽不为零但极小,偶尔出现的巨额权重又可能让估计非常不稳定。增加样本、改善采样分布与截断权重分别改变什么,应单独说明。
离线评估时保住概率的来源
实际数据处理中,权重分母应对应记录真正被采样的机制;不能把当前策略概率冒充过去采集时的概率。若按多轮动作轨迹评估,还要区分单步比值与整条轨迹比值,本例两类静态记录的算式不能不加说明直接套用。
报告结果时标明估计形式、样本数、权重范围与支持范围。只说“已重新归一,所以概率正确”会掩盖问题。自归一只是如何组合已有样本的一项选择,不能修复漏掉的数据区域,也不能把有限样本偏差自动消除。
资料核对日期:2026年10月2日。数据为原创教学设定,已用独立本地程序复核,未进行真实模型训练或生产效果测试。


