用 AI 算高斯混合责任度:两个中心相同,为何归属仍不各占一半

前天 3阅读

如果AI把高斯混合模型解释成“看点离哪个中心近”,它便漏掉了分布的宽度。可以把两个中心设成完全相同,让距离失去区分能力,再检查模型如何用概率密度给出不同责任度。

用 AI 算高斯混合责任度:两个中心相同,为何归属仍不各占一半

AI模型生成的概念插图:一个观测与两种宽度的分布相联系;曲线中心、面积和高度不对应正文参数,不是精确概率图或模型截图。

两个分量只在宽度上不同

固定一维混合模型:分量A的均值是0、标准差是1;分量B的均值也是0、标准差是2;混合权重各0.5。这里B的方差是4,不是2。本例直接给定参数,只计算观测的归属,不执行EM拟合。

均值为0、标准差为σ的正态密度可写成:exp(-x²/(2σ²))除以σ√(2π)。指数描述离中心多远,分母中的σ则保证整条曲线下的面积为1。曲线加宽时,峰值必须降低;不能只把σ放进指数而漏掉前面的缩放。

对某个观测x,先分别计算0.5×A密度与0.5×B密度,再除以这两项之和,就得到A、B的责任度。它们是在当前模型下,给定这个观测后对分量身份的条件概率,二者应相加为1。

在中心和尾部各放一张卡

第一张取x=0。A密度约0.398942,B密度约0.199471,前者恰为后者两倍。等混合权重下,A责任度为2/3,B为1/3。两者到观测的中心距离都是0,但窄分布在中心更集中,因而获得更大份额。

第二张取x=2。A密度约0.053991,B密度约0.120985;归一化后,A责任度约0.308562,B约0.691438。现在观测距A中心恰为两个标准差,距B中心恰为一个标准差,较宽的B在这里提供了更高密度。两个分量仍然有同一个均值。

若漏掉密度公式前面的1/σ,在x=0处就会把两个指数都算成1,错误得到各一半;在x=2处也会夸大宽分量。要求AI把“标准化距离、指数项、密度、乘混合权重后的量、归一后的责任度”分列,就能定位这一遗漏。

软归属不是复制两份观测

一张观测可以对两个分量都有非零责任度。EM后续更新均值时,使用的是这些软权重形成的加权平均,而不是把这张观测完整计入两组。如果最终必须输出单一簇标签,可以选责任度最大的分量,但那会丢掉0.308562对0.691438这样的不确定程度。

还要分清密度与概率。上面的0.398942不是“恰好抽到数字0的概率”;连续分布在单个精确点的概率为0,区间概率需要积分。责任度之所以可以作为分量概率,是因为它把同一点上各分量的加权密度作了归一化。

人工核对时可把两分量的参数全部设为相同,此时责任度应回到混合权重各0.5。真实多维数据还需考虑协方差、分量数量和正则化;某个分量的高密度并不证明它代表一个有业务意义的人群。这份练习只验证概率机制,不替聚类结果命名或宣称发现真实类别。

资料核对日期:2026年10月2日。算例为原创教学设定,已用独立Python计算复核,不代表真实模型训练或性能测试。

参考资料

scikit-learn:Gaussian mixture models

SciPy:正态分布密度及scale定义

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。