标签传播何时有唯一答案:从调和解检查无标签分量
只有少量样本有标签时,可以把相似样本连接成图,让已知标签影响邻近节点。这里最容易漏掉的条件是:一个待预测区域,究竟能不能通过边走到已知标签。即使程序返回了整齐的零和一,也不能据此认为每个分量都获得了监督信息。
AI生成概念示意图:两端有颜色的链表示带标签边界,右侧灰色分量没有标签锚点;颜色和距离不是概率或边权的精确刻度。
把已知标签当作固定边界
考虑无向、非负加权图,节点依次为A、U、V、B。A的标签固定为0,B的标签固定为1;U、V未知。三条边为A—U,权重2;U—V,权重1;V—B,权重3。没有其他边,也不添加自环。
用实数u、v表示未知节点的软标签。我们选择最小化E=2u²+(u-v)²+3(v-1)²。这里每条无向边只算一次;若写成所有有序节点对求和,就应加相应的二分之一系数,不能把不同能量约定拼接后再比较绝对数值。
这个目标惩罚相连节点标签差异,权重大意味着更不希望两端相差太多。已知标签在整个求解中保持不变。这是硬边界的调和标签模型,不能与允许原标签一起漂移的软约束方法混为一谈。
从局部平均推出全局解
对u求导,得到4u+2(u-v)=0,即3u-v=0。对v求导,得到2(v-u)+6(v-1)=0,即-u+4v=3。联立可得u=3/11≈0.272727,v=9/11≈0.818182。
同样的结果可以写成加权平均:u=(2×0+v)/3,v=(u+3×1)/4。未知点必须等于邻居值的加权平均,这就是图上的调和条件。注意“平均”的权重由连边决定,不是每个邻居都占同样比例;V贴近标签1,因为通向B的边权为3。
把解代回能量,三项分别为18/121、36/121和12/121,总能量为6/11。如果把U、V都设为0.5,总能量为1.25;调和解确实更低。这个比较用于检查具体构造,不意味着每个能量更低的图模型都能获得更高真实分类准确率。
若最后用0.5作二分类阈值,U归为0类,V归为1类。但阈值是输出决策的一部分,不包含在刚才的平滑能量里。类别先验、不同错误成本或后续校准可能要求其他决策方式,不能把“低于一半”自动等同于业务上的拒绝条件。
拉普拉斯分块里藏着可解性
设W为对称权重矩阵,D的对角元为节点加权度,L=D-W。把节点分成已标注集合l与未标注集合u,边界值记为f_l,则未知值满足L_uu f_u=-L_ul f_l。本例L_uu的两行为(3,-1)、(-1,4),右侧为(0,3),行列式是11。
这里的度数3和4必须包含通向已标注节点的边。如果先删掉A、B,再在剩余两点上重算度数,会错误得到两行(1,-1)、(-1,1),把决定答案的边界联系抹去。所谓取子块,是从完整拉普拉斯截取,不是重新建立一个无边界的小图。
工程上可求解稀疏线性系统,不必显式形成逆矩阵。验收至少检查边界未变、线性方程残差小,以及在本例中软值落在0到1之间。若出现明显越界,应先检查负边权、非对称构造、节点顺序或数值失败,而不是立即裁剪来掩盖原因。
添加两个没有锚点的节点
现在另加P、Q,两者之间只有一条权重1的边,并且完全不连接前面的链,也都没有标签。新增能量仅为(p-q)²。只要p=q,不管都取0、0.5还是1,新增能量都是0,因此有无穷多个同样好的答案。
对应的块是两行(1,-1)、(-1,1),行列式为0,向量(1,1)属于零空间。程序使用伪逆可能给出全零;那是求解器选择的某个解,不是数据证明了两点属于0类。若直接把零转成确定标签,就会把“无信息”包装成“有把握”。
对有限无向图,使用正权重边定义连通分量时,只要每个含未知点的分量都能到达至少一个已标注点,受约束块便可唯一求解。一个完全孤立的未知节点更加直接:它没有任何平滑项约束,局部平均还会遇到除以零。处理策略应先于求解明确下来。
可以将无锚点分量标记为待补标签,安排人工标注,或明确引入外部分类器与先验。若加上ε||f-c||²,确实可以把解拉向先验c并消除这类不确定性,但新答案来自额外假设。把矩阵加一个很小的对角数后继续称为“原始调和解”,会隐藏重要的模型变化。
随机游走解释也有同一个边界
把边权归一成跳转概率,从某未知点出发,走到第一个已标注点便停止。在上述有锚点的有限图里,f可以解释为首先碰到标签1边界的概率;对无标签的独立分量,游走永远碰不到边界,这个解释自然失效。
即使所有分量都有锚点,也不代表标签传播总适合任务。边表达的相似性必须与标签目标有关;错误标签会沿连接扩散,跨类别的强边会把本应分开的样本拉近。若只有一条极弱边连接标签区域,数学上仍可能唯一,数值条件和对边权的敏感性却值得单独检查。
构图时还要说明近邻关系怎样变成无向边。只要一方选中对方就连边,与双方互为近邻才连边,会产生不同连通分量;后者可能更稀疏,也更容易出现无标签区域。因此应在图真正构好以后检查标签覆盖,不能只凭近邻参数估计每个点都能得到监督。
若边界标签本身可能错误,硬固定也未必合适。此时可以选择允许标签偏离观测值的惩罚形式,并在目标中公开惩罚强度;但应重新推导对应系统与验收条件。把噪声标签锁住,再要求传播过程自动纠正它们,实际上是在提出模型没有被允许完成的任务。
还有一种容易误读的情形:某个分量仅有零类锚点,那么常数零可以成为唯一解。这次全零确实由边界条件推出,却仍不能证明该分量没有其他类别,只说明现有标签与平滑假设没有提供其他信号。监督覆盖不足和求解器失败应分别记录。
本文分别用符号求导、线性系统和固定边界的同步平均迭代得到相同解,并构造奇异块验证无穷多解。真实项目还应在构图前划分评估用途,说明测试点是否作为无标签节点参与图结构;这种传导式设置不能不加说明地当成对全新样本的泛化成绩。
资料核对日期:2026年10月3日。节点、边权和标签均为原创教学设定,已本地复算;本文没有训练实际分类器或报告数据集准确率。


