随机傅里叶特征:内积算出负数,为什么仍可能是合法核近似 希望给线性分类器加入非线性表达,又不想保存全部样本对的核矩阵时,可以先计算随机傅里叶特征。每个样本被映射到一组固定长度的显式坐标,再用坐标内积近似目标核。真正需要验收的是近似误差及映射的一致性,而不只是程序能否输出一... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
Nyström核近似:两个地标选在同一方向,伪逆也补不回另一维 核模型需要比较许多样本对,完整相似度矩阵可能占用大量内存。Nyström方法只选少量样本作地标,再利用这些列近似全矩阵。实施时除了决定留几个地标,还要检查它们覆盖了哪些方向。下面的小例适合拿来验收AI生成的核近似代码... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
分类排序里的 AP 怎么算:别把阶梯加权换成梯形面积 同一批分类预测,两个评测脚本都说自己在算“PR曲线下面积”,数字却对不上。先别归因于浮点误差:一个可能计算非插值平均精确率AP,另一个把曲线点用直线连接后做梯形积分。把五条记录列出来,差别就能追到每一次阈值变化。 yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
自然梯度的坐标不变性到哪里为止:同一枚硬币的两种参数 读到“自然梯度不依赖参数化”,很容易期待:同一个模型换种写法,用相同学习率更新一次后,预测也必须完全相同。把Bernoulli概率p改写成logit,就能看到这个说法需要的局部条件。这个例子适合检查AI对Fisher... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
AdaGrad 怎样记住稀疏梯度:第三步相同的输入,坐标步幅却不同 训练稀疏特征模型时,有些参数几乎每批都出现梯度,另一些只偶尔参与。AdaGrad为每个坐标保存自己的平方和。同一时刻共用一个学习率,并不意味着所有坐标都会按相同比例移动。理解这份历史,也能判断为什么只恢复模型权重还不... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
SAM 的临时扰动该不该留下:用一个二次损失检查两次梯度 把SAM接进训练代码时,一个容易藏住的错误是:先把权重移到扰动位置,再直接在那里执行优化器更新。两次反向传播都成功,损失也可能下降,结果却偏离算法。拿一个能手算的目标检查“在哪里求梯度、从哪里出发”,比只看训练曲线更... yunqueblog/ AI分享/ 2026-10-03/ 2 阅读
用 AI 复算 Cohen kappa:同样九成标注一致,为什么分数会差这么多 检查训练标签或AI辅助标注时,两位标注者有九成记录选了同一类,听起来已经很一致。但如果两人几乎总选同一大类,这个比例与类别均衡时的九成不完全一样。Cohen kappa用各自的类别边际构造机会一致基线,因此两组九成可... yunqueblog/ AI分享/ 2026-10-03/ 3 阅读
让 AI 检查转置卷积:长度恢复了,为什么原来的数值没有回来 图像生成与解码器里常用转置卷积扩大特征尺寸,因此容易把它理解为卷积的撤销操作。尺寸回到原来,只说明形状对上了。转置卷积对应的是线性算子的转置,也叫伴随;要验证它,内积关系比“能否还原输入”更合适。 yunqueblog/ AI分享/ 2026-10-03/ 3 阅读
用 AI 核对重要性采样:权重再归一一次,估计为什么反而出现偏差 离线评估或概率推断中,手里的样本可能来自q,关心的平均值却属于p。重要性采样用p/q补偿来源差异,但普通加权平均与“把权重再归一到一”是两种估计量。自归一常有实用价值,却不能据此声称有限样本完全无偏。 yunqueblog/ AI分享/ 2026-10-03/ 3 阅读
让 AI 算 L1 近端更新:小权重为什么直接归零,而不是穿过零点 做稀疏线性模型或系数去噪时,希望一些参数真正变成零。但在损失里加上L1惩罚后,直接沿符号梯度走一步,可能只是把一个小正数推成小负数。近端更新通过求一个小优化问题,把零点附近的一整段输入准确收拢到零。 yunqueblog/ AI分享/ 2026-10-03/ 3 阅读