最新谱归一化只做一次幂迭代:除过范数以后,最大伸长为何仍超过一 把权重矩阵除以谱范数,可以控制这层线性映射的最大长度放大倍数。实际训练常用少量幂迭代近似最大奇异值,避免每步做完整分解。两句话合起来容易被误读成“只要启用了谱归一化,真实最大伸长就精确等于一”。一个二阶矩阵已经足以看... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新Nesterov先到哪里看梯度:前瞻点用旧速度,不能多走一次 “Nesterov会提前看一眼”是一种方便的记忆法,却很容易让实现多加一次动量,或者在错误的位置求梯度。它没有预知下一步的真实结果,而是在一个由旧速度确定的前瞻点上重新评估当前损失。把参数、速度和求梯度的位置逐项记录... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新PRESS留一残差为何会放大:训练时贴得很近,也可能靠样本自己撑住 训练残差是在样本参与拟合之后计算的;留一残差则要求先移走该样本,再预测它。对于普通最小二乘,后者可以用训练残差和杠杆值直接算出,避免逐条重新拟合。这个快捷式不只是省计算,也揭示了为什么一条训练误差很小的记录,离开它自... yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新正交Procrustes对齐要不要允许镜像:零误差答案,也可能翻转了方向 两个模型的向量坐标系不同,或者两组对应点只差整体方向时,可以寻找一个正交矩阵把它们对齐。正交变换保持长度和内积,却既包含旋转,也包含镜像反射。如果任务只允许物体转动,直接接受一个零误差的正交解,可能已经越过了允许的动... yunqueblog/ AI分享/ 2026-10-04/ 2 阅读
最新NDCG先约定收益再归一:同一排序,换一种标签解释就会换分数 检索系统给出一列结果以后,只知道“相关的排得更前”还不足以复现一个NDCG数值。相关等级要怎样变成收益、位置怎样折扣、理想榜单从哪些候选产生,以及并列分数如何处理,都会进入最终结果。下面固定三个文档,让每个约定都能单... yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新Brier分数相同也要拆开看:校准、分辨率和事件本身各占哪一份 分类模型输出0.8时,含义应当比“最后判成正类”更丰富。Brier分数用概率与实际0/1结果之间的平方误差衡量这种预测,数值越低越好。一个总分却混合了概率是否可信、模型有没有区分不同风险,以及这批事件本来有多难猜。先... yunqueblog/ AI分享/ 2026-10-04/ 1 阅读
最新Python 线性回归与相关系数:相关都是一,为什么斜率相差十倍 一个指标与另一个指标完全沿直线变化,相关系数等于一;把纵轴单位放大十倍后,相关系数仍是一,但回归斜率却变成十倍。若把这两个结果都叫作“相关程度”,报表就容易把单位变化误读成关系变强。Python标准库可以用很短的程序... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读
最新SQLite deterministic 函数标志:两处参数完全相同,为什么回调仍可能执行两遍 把昂贵的Python函数注册给SQLite,并加上deterministic=True以后,直觉上可能期待相同参数只计算一次。但这个标志首先是在承诺函数结果具有确定性,不是在申请一个跨表达式、跨行乃至跨查询的缓存。若... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读
最新Node.js path.format 字段优先级:已经把 ext 改成 md,为什么生成的文件名仍是 txt 工具先用path.parse拆开文件路径,把ext从.txt改成.md,再调用path.format拼回去,却发现扩展名完全没变。这不是对象展开没有写入新字段,而是拆解结果同时保存了完整文件名base和分开的name... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读
最新Node.js Blob 字节快照:原 Buffer 已经改了,为什么读取的内容仍然没变 准备一个上传体以后,又复用原来的Buffer作为下一轮工作区。如果上传体引用的是同一段可变内存,后来修改可能改变即将发送的内容;如果已经生成稳定快照,修改则只影响原工作区。Node.js的Blob适合从这个边界来理解... yunqueblog/ 技术教程/ 2026-10-04/ 1 阅读