一段声音切得更细,置信度就该更高吗:检查 noisy-OR 汇聚
声音识别模型可能先给每个短片段打分,再判断整段录音中有没有某种事件。若把录音切得更密,片段级分数几乎没变,整段分数却大幅上升,应该先检查汇聚规则。noisy-OR给出了一个容易复算的例子:样本条数与独立信息量不能直接画等号。
AI生成的概念示意图:多张重叠卡片可能记录同一事件;图中波形为装饰性示意,不是录音数据或模型输出。
先把整段为正的事件定义清楚
设三个片段对应的正类概率为p₁=0.2、p₂=0.3、p₃=0.1。若整段的正类定义是“至少一个片段为正”,并且这些事件在给定所用信息后相互独立,那么全都为负的概率是(1-p₁)(1-p₂)(1-p₃)。用1减去它,得到整段概率P=1-0.8×0.7×0.9=0.496。
这就是本文的noisy-OR规则。三个概率的最大值为0.3,平均值为0.2,都与0.496不同。最大值和平均值可以作为其他模型的汇聚选择,但没有理由要求它们在“至少一次”的独立事件问题中给出同一个答案。
重复一次记录,计算会发生什么
现在仅把概率0.3的那一条复制一份,输入变成四条。机械套公式得到1-0.8×0.7×0.9×0.7=0.6472,比原来增加0.1512。模型没有看到新事件,这个变化只是公式多乘了一次0.7。
若复制条目确实表示同一个随机事件,两份记录会同时为正或同时为负。它们联合为负的概率仍为0.7,而非0.49。因此正确描述相关性的“至少一次”概率仍是0.496。相反,若新增的真是另一独立事件,0.6472才与新的事件设定相符。
音频相邻帧、视频相邻画面或重叠裁剪常共享信息。不能仅因数组里有四行,就宣布存在四次独立证据。这里需要检验的是汇聚层概率解释的假设,并不是禁止模型内部在片段之间交换上下文。
很多小分数也会累积成很大的整段分数
另设四十个独立片段,每个概率只有0.03。公式给出1-0.97⁴⁰,约0.704288。若它们确实是独立机会,这个数完全合理;若只是同一事件的重复切片,就可能把长度当作证据。换帧率、窗口长度或重叠比例之后,应重新检查分数分布。
单个片段影响总分的程度也可计算:P对pᵢ的导数为其余所有(1-pⱼ)的乘积。三片段例子的三个导数是0.63、0.72、0.56,本地有限差分得到相同结果。它们没有先挑出一个最大分数,而是通过其他片段的剩余负类概率调整影响。
让AI构造重复与长度两组压力测试
可以要求AI:“保留原片段ID和时间范围;输出最大值、平均值、noisy-OR及其假设;复制一段、改变切片密度,逐项解释总分变化。”复制测试用于揭示长度敏感性,不要求所有任务的理想输出都不变。真正新增独立观测时,合理的概率本来就可能改变。
实现上可先求logQ=各项log(1-pᵢ)之和,再通过稳定数值函数计算1-exp(logQ),避免大量连乘的下溢或接近1时的相减损失。必须单独处理p=1等边界,不能用随意裁剪后的概率掩盖含义变化。
整段标注只告诉模型是否出现过事件,并未提供发生位置。整段分数高,也不自动证明最高分片段就是正确定位。实际验收应同时保留整段任务指标、片段定位证据和切片配置;这比给每个小数再多保留几位更能帮助读者解释一次汇聚结果。
资料核对日期:2026年10月3日。本文数值为原创教学设定,已用本地程序复算,未训练真实模型或验证生产效果。
参考资料
Wang等:Comparing the Max and Noisy-Or Pooling Functions,第2节


