让 AI 算 PPO 裁剪项:概率比同样超界,优势符号为何改变结果
看到PPO公式里的clip,容易让AI把所有超界的概率比都替换成边界,算完便结束。但原式还要比较裁剪前后两项,优势的正负会改变哪一项被保留下来。四格手算比一句“限制更新幅度”更能说明这件事。
AI模型生成的概念插图:上下限与不同方向的变化分别呈现;造型不是精确PPO目标曲线、训练记录或软件截图。
先写出要最大化的单样本目标
设r为同一状态、同一已采样动作的新策略概率除以旧策略概率,裁剪范围取[0.8,1.2]。单样本目标为min(r×A,clip(r,0.8,1.2)×A),A是本次固定的优势估计。本文讨论这个要最大化的目标;若实现采用最小化损失,通常还会在外面加负号。
例如旧策略给这个动作0.2,新策略给0.3,则r=1.5。优势A=2时,未裁剪项是3,裁剪项是2.4,取较小值得2.4。再增大r,单看这一项便没有继续提高目标的奖励。
保持r=1.5,改用另一张计算卡A=-2。未裁剪项是-3,裁剪项是-2.4,较小值是-3。因此这一项仍使用超界后的原始概率比,不能直接把答案写成-2.4。对于负优势动作,提高其概率会让目标更差,这种不利变化没有被裁剪替你遮掉。
下界也要带着符号一起计算
另设旧概率0.2、新概率0.1,得到r=0.5。若A=2,两项分别是1和1.6,结果为1;降低有利动作的概率仍会降低目标。若A=-2,两项分别是-1和-1.6,结果为-1.6,继续降低r不会再增加这一项的收益。
把四张等权卡按“r=1.5、A=2;r=1.5、A=-2;r=0.5、A=2;r=0.5、A=-2”排列,结果是[2.4,-3,1,-1.6],平均为-0.3。这些是独立构造的数值例子,不是一段真实轨迹,也不是同一状态下四个必须同时成立的动作概率。
它们共同揭示:裁剪主要截住沿有利方向过度改善这一替代目标的收益,并非无论情况都把r硬约束在区间内。实际策略参数仍可能在其他样本、共享参数或其他损失项作用下继续改变,不能从公式推出所有动作概率比都不越界。
让 AI 同时交原项、裁剪项和选中项
检查时让AI保留三列,先算clip后的r,再各自乘A,最后取min。不能先对两种r取min再乘可能为负的A,因为负数乘法会改变大小关系。还应写明优势是否经过归一化,以及报告的是最大化目标还是带负号的损失。
读者可在r=1处补一张卡,两项都等于A;A=0时任意正r都得到0。这些边界便于发现符号错误。旧策略概率须在使用的样本上为正;实现中常用对数概率差求r,也应确保分母来自收集这批样本的旧策略。
本文未加入价值损失、熵奖励或KL监控,也未评价PPO实际效果。裁剪阈值0.2是便于演示的设定,不是对任何任务的推荐值;把单项算清楚以后,才有条件解释整份训练目标。
资料核对日期:2026年10月2日。算例为原创教学设定,已用独立Python计算复核,不代表真实模型训练或性能测试。


