用 AI 核对 DPO 偏好比:喜欢的回答概率更高,为何损失仍然不小 看到DPO中的胜出回答和落选回答,容易只问“胜出回答的概率是否更高”。标准DPO还要看这组相对偏好相比参考策略改变了多少。把完整回答缩成两个事件,就可以用普通分数验算这个差别。 yunqueblog/ AI分享/ 2026-10-02/ 3 阅读