UMAP同一距离为何有两个权重:从局部尺度算到模糊并集

22分钟前 2阅读

两个点之间的欧氏距离是对称的,但UMAP最初得到的邻接权重可以不对称。原因并不是距离函数坏了,而是每个点用自己的局部尺度解释“附近”。只有完成局部赋权后,算法才把两个方向合成一条无向关系。直接取平均,会错过其中的关键设计。

UMAP同一距离为何有两个权重:从局部尺度算到模糊并集

AI生成概念示意图:不同大小的邻域和双向连接表示局部尺度不同,不是本文六个一维样本的精确布局或最终嵌入。

先区分距离、局部半径与尺度

本文讨论普通训练图构建、局部连通参数为1、纯模糊并集的情形。对点i的近邻j,方向权重可写成wᵢ→ⱼ=exp[-max(0,dᵢⱼ-ρᵢ)/σᵢ]。自身边另外置零。ρᵢ提供局部连通偏移,σᵢ控制超过该偏移后的衰减速度。

在本例没有重复点,ρᵢ就是最近非自身邻居的距离;因此最近邻权重为1。默认实现遇到重复点时会参考正距离,并对非整数局部连通参数作插值,不能把这一简化公式的ρ选择当作所有配置的完整行为。邻居未进入候选列表时,对应方向在稀疏图中为零。

σᵢ也不是全局手工固定的带宽。官方平滑近邻步骤会搜索尺度,让局部权重之和接近log₂k;本例用k=4的邻居数组,第一项为自身,另外三项才参与求和,目标为2。这里明确计数约定,是为了避免把“四个数组项”误读成“四个非自身邻居”。

六个真实坐标构成可复算的小图

取一维坐标-3、-1、0、3、5,以及5+ln(4/3)/ln4,最后一点约为5.207519。使用普通欧氏距离。我们只重点检查坐标0与坐标3之间的边,其他点用来让两端的局部尺度有完整、相容的来源。

从坐标0看,三个最近的非自身邻居为-1、-3、3,距离为1、3、3。所以ρ₀=1。取σ₀=2/ln2≈2.885390,三个权重依次为1、1/2、1/2,正好加到2。坐标0指向坐标3的权重因此是1/2。

从坐标3看,三个最近的非自身邻居为5、5.207519和0,距离为2、2.207519和3。所以ρ₃=2。取σ₃=1/ln4≈0.721348,三个权重为1、3/4、1/4,同样加到2。坐标3指回坐标0的权重则是1/4。

同一对点的原始距离都为3,但减去的局部偏移和除以的局部尺度不同,所以两个方向权重不同。这里没有凭空指定两组参数:从同一组真实坐标找近邻,再解各自的尺度方程,才能同时得到上述结果。这个顺序适合用作实现的端到端小测试。

模糊并集得到的是5/8

设两个方向权重为a与b。默认的模糊并集采用a+b-ab,也可写成1-(1-a)(1-b)。本例代入a=1/2、b=1/4,结果为1/2+1/4-1/8=5/8,即0.625。合成后的两个方向使用同一个值,图于是对称。

它不是算术平均0.375,也不是最大值0.5,更不是乘积0.125。对处于零到一区间的权重,并集至少不小于任一方向,且不会超过1;若某方向为零,就保留另一个方向;若某方向为1,合成结果就是1。这些边界都能作为独立断言。

公式在形式上类似两个独立事件至少发生一个的概率,但这里使用的是图边的模糊隶属度组合规则,不能据此声称已经建立真实事件独立性的统计模型。权重0.625也不是“两点属于同一真实类别的概率”,它表达的是这套近邻构建下的连接强度。

默认设置之外要重新说明操作

官方参数允许在模糊并集与交集之间混合。若混合比例为λ,组合为λ(a+b-ab)+(1-λ)ab。λ=1是刚才的并集,λ=0是乘积交集;本例λ=1/2时恰好得到0.375。这时数值等于算术平均,是混合式的代数结果,不代表默认操作一直是平均。

两种极端还会改变单向边的命运。若某点把另一点列为近邻,但反向列表里没有它,那么其中一个方向为零;并集保留已有连接,纯交集却把它删除。因此参数会改变图的连通关系,不只是调整最终图像的颜色深浅,实际用途需要检查分量和弱连接。

局部权重和为2,也不表示每行是一条概率分布。把每行再除以总和归一到1,会改变送入后续优化的边强度;对称化之后各行之和还会进一步变化。除非明确在实现不同模型,不应为了“看起来像概率”而加上这一步处理。

先验收图,再谈二维位置

本例可分三层验收。第一层,直接从坐标计算完整距离矩阵,检查两个近邻列表及其顺序;第二层,用独立求根程序求σ,重新计算每行权重和;第三层,按矩阵形式W+Wᵀ-(W⊙Wᵀ)得到对称图,检查目标边为0.625。

矩阵公式里的乘法是对应位置相乘,不是普通矩阵乘法。若写成W乘Wᵀ,就会聚合共享邻居路径,变成另一种对象;结果即使仍然对称,也不能通过目标边和边界测试。只验收对称性,抓不住这种很常见的运算符错误。

实际数据还要考虑距离并列、重复点、近似近邻遗漏以及很小尺度的数值保护。如果多个邻居都落在ρ以内,它们各自贡献1,目标总和可能无法精确达到;实现设置的迭代容差与尺度下限也会影响结果。因此手算例应避开退化情况,额外再为退化输入写专门测试。

改变特征缩放或距离度量,可能先改变近邻名单,再改变局部参数,影响会沿着整条构图流程传递。若发现二维图变化,最好先比较邻接图,再检查优化随机性。直接把所有变化归因于最后一步布局,会让前面的距离定义错误长期藏在可视化里。

图关系不等于原始空间的等比例地图

构图完成后,UMAP还需要在低维空间优化另一套关系,得到可视化或降维表示。本文只复算高维图的局部尺度与边合并,不能从这个小例子推出最终坐标,也没有证明某种参数会提升聚类准确率。局部缩放本身已经说明,原始绝对距离不是被原样保留下来的唯一对象。

阅读最终图时,簇的大小、空隙和彼此间距应结合原始特征、图结构与任务验证来解释。若要比较不同群体的密度,不应只凭散点图上哪团更紧;若要给新样本分配类别,也需要明确的下游模型和独立评估,不能把边隶属度直接变成类别置信度。

资料核对日期:2026年10月3日。六点坐标与局部尺度均为原创教学构造,已用解析值、独立求根和完整图矩阵复算,未执行完整UMAP降维实验。

参考资料

UMAP官方源码说明:smooth_knn_dist、compute_membership_strengths与fuzzy_simplicial_set

UMAP官方:How UMAP Works


文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。