最新C51把回报投回固定网格:概率没丢,均值与方差会怎样变 分布强化学习把随机回报表示为一整份分布,而不只保存一个期望。C51的类别表示使用固定回报支撑点;一次Bellman目标经过奖励平移和折扣缩放,落点往往不再位于原网格,于是需要把概率投回去。最容易写错的地方,是把“落点... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读