用 AI 核对 DPO 偏好比:喜欢的回答概率更高,为何损失仍然不小

前天 3阅读

看到DPO中的胜出回答和落选回答,容易只问“胜出回答的概率是否更高”。标准DPO还要看这组相对偏好相比参考策略改变了多少。把完整回答缩成两个事件,就可以用普通分数验算这个差别。

用 AI 核对 DPO 偏好比:喜欢的回答概率更高,为何损失仍然不小

AI模型生成的概念插图:当前偏好与参考偏好成对比较;天平位置不代表精确概率,也不是训练记录或软件截图。

先确定四个概率属于同一个问题

固定一个提示,偏好数据指定W胜出、L落选。参考策略给完整回答W概率0.4、L概率0.1,其余回答总概率0.5。当前策略第一版给W为0.3、L为0.15,其余为0.55。这些是两条完整回答的条件概率;它们不是同一个token的两种概率,也没有要求W与L加起来等于1。

取β=1。先计算当前W/L之比,再除以参考W/L之比,记为R。标准单对DPO损失可写成-ln(sigmoid(ln R)),在这里等价于ln(1+1/R)。所有对数采用自然对数,W与L的次序不能交换。

当前偏好两倍,还比参考偏好弱

参考W/L=0.4/0.1=4,当前W/L=0.3/0.15=2,因此R=2/4=0.5。sigmoid(ln 0.5)=1/3,损失为ln 3,约1.098612。虽然当前仍给W更大概率,但相对于参考策略原来四倍的偏好,它只剩两倍。

若当前与参考的W/L之比相同,R=1,损失为ln 2,约0.693147。这个基准来自两者相对比值相同,不要求两个策略的全部概率完全一样。也不能把sigmoid得到的1/3直接说成某次用户真实选择W的频率。

再给当前策略第二版:W为0.2,L为0.025,其余为0.775。当前比值是8,R=8/4=2,损失为ln(1.5),约0.405465。相比第一版,损失降低了,W的绝对概率却从0.3降到0.2。因为L下降得更快,W对L的相对优势扩大了。

怎样让 AI 交出能复算的比较

核对清单应保留参考W、参考L、当前W、当前L四个原数,再列两组W/L、比值R、ln R、sigmoid值和负对数。用第二版检查“损失降低必然提高胜出回答概率”的说法,就能明确指出反例,不必诉诸一条未经验证的训练经验。

如果改β,作用在ln R上,不能先把两个概率随意乘β再声称同一件事。实际语言模型通常把回答部分逐token的条件对数概率相加;是否包含结束符、哪些位置被掩掉、是否做长度处理,都应和所采用实现对齐。把总和悄悄换成平均值,也可能改变长短回答的比较。

这两版概率只是合法的手算输入,不是一条实际优化轨迹,也未证明训练会走到第二版。偏好标签的质量、参考策略的选择以及其他样本的共同作用都没有包含在算例里。DPO损失能检查相对偏好的目标形式,不能单独担保事实正确、全面提升或每个好回答的绝对概率都上升。

资料核对日期:2026年10月2日。算例为原创教学设定,已用独立Python计算复核,不代表真实模型训练或性能测试。

参考资料

Rafailov等:Direct Preference Optimization,式7

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。