云鹊BLOG云鹊BLOG云鹊BLOG
  • 首页

云鹊BLOG云鹊BLOG云鹊BLOG

当前位置:首页关于 AI基础 的文章
KL遇到零概率为何发散:换成JS以后,有限也不代表尺度相同

最新KL遇到零概率为何发散:换成JS以后,有限也不代表尺度相同

比较两份模型概率时,KL散度经常出现无穷值,而JS仍是一个有限小数。两者并不是把同一个公式换了名字:方向、参考分布、支持集和返回值定义都有区别。先把概率压成两个格子,就能明确哪些无穷值是输入边界的正确含义,哪些数值差...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 2 阅读
Metropolis–Hastings为何要看回程概率:更常被提议,不该更常留下

最新Metropolis–Hastings为何要看回程概率:更常被提议,不该更常留下

贝叶斯推断和概率模型里,常能算出某个状态相对多合理,却不能直接从目标分布抽样。Metropolis–Hastings用“先提议,再接受或停留”构造一条马尔可夫链。若提议机制偏向某个方向,接受率必须考虑反向提议有多容易...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 2 阅读
谱归一化只做一次幂迭代:除过范数以后,最大伸长为何仍超过一

最新谱归一化只做一次幂迭代:除过范数以后,最大伸长为何仍超过一

把权重矩阵除以谱范数,可以控制这层线性映射的最大长度放大倍数。实际训练常用少量幂迭代近似最大奇异值,避免每步做完整分解。两句话合起来容易被误读成“只要启用了谱归一化,真实最大伸长就精确等于一”。一个二阶矩阵已经足以看...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 2 阅读
Nesterov先到哪里看梯度:前瞻点用旧速度,不能多走一次

最新Nesterov先到哪里看梯度:前瞻点用旧速度,不能多走一次

“Nesterov会提前看一眼”是一种方便的记忆法,却很容易让实现多加一次动量,或者在错误的位置求梯度。它没有预知下一步的真实结果,而是在一个由旧速度确定的前瞻点上重新评估当前损失。把参数、速度和求梯度的位置逐项记录...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 2 阅读
PRESS留一残差为何会放大:训练时贴得很近,也可能靠样本自己撑住

最新PRESS留一残差为何会放大:训练时贴得很近,也可能靠样本自己撑住

训练残差是在样本参与拟合之后计算的;留一残差则要求先移走该样本,再预测它。对于普通最小二乘,后者可以用训练残差和杠杆值直接算出,避免逐条重新拟合。这个快捷式不只是省计算,也揭示了为什么一条训练误差很小的记录,离开它自...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 1 阅读
正交Procrustes对齐要不要允许镜像:零误差答案,也可能翻转了方向

最新正交Procrustes对齐要不要允许镜像:零误差答案,也可能翻转了方向

两个模型的向量坐标系不同,或者两组对应点只差整体方向时,可以寻找一个正交矩阵把它们对齐。正交变换保持长度和内积,却既包含旋转,也包含镜像反射。如果任务只允许物体转动,直接接受一个零误差的正交解,可能已经越过了允许的动...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 2 阅读
DPP怎样给一组选项打分:两件都很好,合在一起却可能概率为零

最新DPP怎样给一组选项打分:两件都很好,合在一起却可能概率为零

为检索结果、文档摘要或示例库挑一组材料时,逐条高分不保证整组互补。行列式点过程DPP把集合里的相似性放进联合概率:平行的特征方向无法提供新的体积,因而不鼓励被一起选入。这个几何描述很容易听懂,但只有把所有子集列出来,...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 1 阅读
C51把回报投回固定网格:概率没丢,均值与方差会怎样变

最新C51把回报投回固定网格:概率没丢,均值与方差会怎样变

分布强化学习把随机回报表示为一整份分布,而不只保存一个期望。C51的类别表示使用固定回报支撑点;一次Bellman目标经过奖励平移和折扣缩放,落点往往不再位于原网格,于是需要把概率投回去。最容易写错的地方,是把“落点...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 1 阅读
Double Q如何拆开选择与估值:挑中的最高数,不能再给自己打分

最新Double Q如何拆开选择与估值:挑中的最高数,不能再给自己打分

在强化学习里,下一状态的最高动作价值经常被拿来构造学习目标。如果每个动作的估计都有噪声,“选择最高估计”会偏向碰巧偏高的那一项。Double Q的关键动作是让一份估计选择动作,再让另一份估计评价这个已选动作。两份数组...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 1 阅读
REINFORCE减去基线以后:梯度均值不变,方差为什么反而可能更大

最新REINFORCE减去基线以后:梯度均值不变,方差为什么反而可能更大

策略梯度实现里常出现“奖励减去基线”。这个减法允许改变样本更新的波动,同时保留想估计的梯度,但前提和数值效果要分开检查。基线满足无偏条件,并不代表它一定降低方差。下面只研究一个单状态、执行一次动作就结束的任务,让所有...

yunqueblogyunqueblog/ AI分享/ 2026-10-04/ 1 阅读
  • 1
  • 2
  • 3
  • 4
  • 5
  • 6
  • 7
  • 8
  • 9
  • 下一页
  • 末页
  • 共 9 页
点击查看更多
Copyright2020后台修改文字. 基于Z-BlogPHP搭建