AdaGrad 怎样记住稀疏梯度:第三步相同的输入,坐标步幅却不同 训练稀疏特征模型时,有些参数几乎每批都出现梯度,另一些只偶尔参与。AdaGrad为每个坐标保存自己的平方和。同一时刻共用一个学习率,并不意味着所有坐标都会按相同比例移动。理解这份历史,也能判断为什么只恢复模型权重还不... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读