云鹊BLOG云鹊BLOG云鹊BLOG
  • 首页

云鹊BLOG云鹊BLOG云鹊BLOG

当前位置:首页关于 偏好学习 的文章
用 AI 核对 DPO 偏好比:喜欢的回答概率更高,为何损失仍然不小

用 AI 核对 DPO 偏好比:喜欢的回答概率更高,为何损失仍然不小

看到DPO中的胜出回答和落选回答,容易只问“胜出回答的概率是否更高”。标准DPO还要看这组相对偏好相比参考策略改变了多少。把完整回答缩成两个事件,就可以用普通分数验算这个差别。

yunqueblogyunqueblog/ AI分享/ 2026-10-02/ 3 阅读
  • 1
  • 共 1 页
Copyright2020后台修改文字. 基于Z-BlogPHP搭建