谱归一化只做一次幂迭代:除过范数以后,最大伸长为何仍超过一
把权重矩阵除以谱范数,可以控制这层线性映射的最大长度放大倍数。实际训练常用少量幂迭代近似最大奇异值,避免每步做完整分解。两句话合起来容易被误读成“只要启用了谱归一化,真实最大伸长就精确等于一”。一个二阶矩阵已经足以看出近似与保证之间的距离。
AI生成的概念示意图,借椭圆伸展与探针表达最大方向和当前估计方向;不是实际产品、真实权重图或精确比例示意。
先求一个无须近似的标准答案
取W=diag(3,1)。它把向量第一坐标放大三倍,第二坐标保持原样,所以精确谱范数σ(W)=3。对任何单位向量x,||Wx||最多为3,沿(1,0)时恰好达到。
如果准确地除以3,得到diag(1,1/3),最大伸长确实为1。这里控制的是欧氏范数下的算子范数,不是所有元素平方和开方的Frobenius范数;后者在原矩阵中等于√10,并非3。
一轮交替归一化具体得到多少
采用论文附录中的次序,从单位左向量u旧=(1,1)/√2开始。先算v=Wᵀu旧/||Wᵀu旧||,得到v=(3,1)/√10。再算u新=Wv/||Wv||,得到u新=(9,1)/√82。
使用匹配的这对u新和v,范数估计为σ估=u新ᵀWv=√(82/10)=√8.2≈2.863564。它比真实最大奇异值3低,因为一轮迭代尚未完全对齐最强方向。
若按这个估计归一化,W归=W/√8.2,真实谱范数是3/√8.2≈1.047645。沿第一坐标输入单位向量,输出长度约1.047645,直接超过1。这个结论不依赖随机实验,拿矩阵乘法就能复查。
估计偏低而不是偏高并不奇怪:对任意单位u、v,|uᵀWv|不可能超过真正的谱范数。当前采到的方向只能给出某种下界;拿下界作除数,不能自动获得所需的严格上界控制。若应用需要认证式限制,必须使用具有相应误差保证的办法。
多迭代几次,也要看起点有没有那条方向
一般起点带有主奇异方向分量时,反复乘Wᵀ与W会相对放大强方向。本例每个完整循环涉及W Wᵀ=diag(9,1),弱方向相对强方向的比例逐轮缩小。这解释了幂迭代的作用,但不代表任意初始化都能恢复最大奇异值。
如果u旧恰好取(0,1),Wᵀu与Wv始终还是(0,1),估计永远为1。除以它以后矩阵毫无变化,真实谱范数仍为3。浮点误差可能偶然带入第一方向,却不能被当作理论保证或可靠的初始化策略。
当最大两个奇异值很接近时,方向收敛也可能较慢。训练中常把上一轮向量保留下来,利用权重通常逐步变化的特点继续迭代;这与每步重新随机初始化是不同流程。权重突然恢复、替换或大幅改变时,旧方向可能暂时不够准确。
零矩阵与近似梯度是另一层问题
W全为零时,Wᵀu的范数也是零,直接单位化会除零;极小范数则容易受数值精度影响。实现使用epsilon或专门分支,需要说明这会如何改变输出,不能只在正常随机矩阵上跑一次就认为边界已覆盖。
还要区分“把范数估计得多准”和“对归一化权重怎样反向传播”。u、v是否从梯度图分离、范数估计中的W如何参与求导,都属于训练算法定义。前向最大伸长检查不能替代梯度检查;相反,梯度数值稳定也不能证明真实算子范数已被严格限制。
卷积核展平成矩阵,不等于完整图像算子
对卷积层,常见实现把核张量按输出通道展开成二维矩阵后计算谱范数。这个矩阵作用于一个局部展开窗口,而完整卷积还涉及窗口重叠、步长、边界与输入尺寸。展平核的范数不应未经证明就被称为整张图像卷积算子的精确谱范数。
类似地,单层线性部分的界不自动等于整张网络的界。激活函数、残差相加以及分支组合都要按各自规则计算。比如两个同方向映射相加,整体伸长可以大于每个分支单独的伸长,不能把“每个模块都归一了”直接当作全网结论。
一份小而有效的验收清单
让AI编写三条测试:对diag(3,1)使用普通起点,核对一轮估计2.863564与真实归一后范数1.047645;使用纯弱方向起点,确认估计停在1;使用零矩阵,检查显式边界处理。再对小型随机矩阵用完整SVD作独立对照,记录估计值、精确值和迭代次数。
报告应区分“训练正则化的近似工具”和“经过证明的数值界”,并留下向量状态、epsilon、矩阵展开方式与精度。本文说明的是近似机制和失效边界,没有复现生成对抗网络实验,也没有声称增加幂迭代次数在所有训练中都值得付出额外成本。
资料核对日期:2026年10月3日。数值均为原创教学设定,使用本地独立程序复算;未进行真实模型训练或生产性能测试。
参考资料
Miyato等:Spectral Normalization for Generative Adversarial Networks,附录A


