让 AI 试算音频交叉淡化:两轨各减一半,中间未必同样响

前天 3阅读

让AI设计两段声音之间的过渡,常会得到“前一轨降到一半,后一轨升到一半,总量正好不变”。这句话把振幅与功率混在了一起,也忽略两轨是否相似。下面用原创数值序列看清中点发生什么,不把纸面计算称为听觉测试。

让 AI 试算音频交叉淡化:两轨各减一半,中间未必同样响

AI生成概念插图:两条声带交叠表达淡入淡出;不是实测波形、响度曲线或软件截图。

先声明比较的是哪一个量

本例将两轨叠加到同一个通道,增益是振幅乘数。用每个样本平方后取平均,作为这段信号的均方功率指标;它不是人耳感到的响度,也不是把分贝直接相加。为了容易手算,数据采用归一化单位,不直接当作可播放的满幅音频。

第一轨四个数是“一、负一、一、负一”,第二轨是“一、一、负一、负一”。两轨各自均值为零,均方值为一;逐项乘积为一、负一、负一、一,平均为零,因此在这个四点窗口里交叉项为零。

各半增益,功率只剩一半

线性交叉淡化的中点,两轨增益都取零点五。相加得到“一、零、零、负一”,四个平方的平均为二除以四,即零点五。两轨的增益之和确实为一,但均方功率不是原来的一。这个结果可以逐项复算,无须凭听感猜测。

若中点两轨增益都取一除以根号二,约零点七零七一,相加得到“根号二、零、零、负根号二”,均方值回到一。在两轨等功率且交叉项为零的条件下,增益平方和为一,便能保持这个功率指标。

整段可采用一条常见数学方案:淡化进度从零到一时,前轨增益取相应四分之一圆角度的余弦,后轨取正弦。两者平方和恒为一。这是本文比较的理想曲线,不宣称等于某软件全部预设的具体实现。

换一组相关性,答案就变了

现在把第二轨换成第一轨完全相同的副本,时间也精确对齐。线性中点为零点五加零点五倍原信号,恰好恢复原值;等功率中点却是根号二倍原信号,均方值成为二。原来适合零交叉项的补偿,此时制造了抬升。

再把第二轨改成第一轨的相反数,两轨在对称中点会完全抵消为零。仅凭两条轨道各自有多响,不能确定混合结果。Audacity官方说明区分了相关素材与无关素材适合的淡化形状,并提醒恒功率类淡化可能提高峰值。

即使第一组零交叉项的例子保持均方值,峰值也从一变成根号二。若实际文件已接近可用输出上限,仍需留出增益余量并检查峰值。功率指标恒定没有自动解决削波,更不能保证不同频谱的两段声音听起来一样响。

可复制的核算提示

“把两轨叠加到同一通道,分别用四点序列一负一一负一和一一负一负一。计算各自均方值、乘积平均、两种中点增益零点五与一除以根号二的输出和均方值。再将第二轨换成相同副本与相反数复算。区分振幅、均方功率、峰值与感知响度,不声称生成过音频。”

本文独立算得第一组中点功率零点五与一,相同副本情形为一与二,反相情形均为零。实际工作先确认片段关系、对齐和淡化区间,再比较试听与表头数据。AI负责解释选择依据,最终过渡是否自然仍需在真实素材上判断。

参考资料

Audacity Manual:Crossfade Tracks

Audacity Development Manual:Crossfade Tracks,Constant Power and peak levels

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。