最新REINFORCE减去基线以后:梯度均值不变,方差为什么反而可能更大 策略梯度实现里常出现“奖励减去基线”。这个减法允许改变样本更新的波动,同时保留想估计的梯度,但前提和数值效果要分开检查。基线满足无偏条件,并不代表它一定降低方差。下面只研究一个单状态、执行一次动作就结束的任务,让所有... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读