让 AI 配一组加法合成音色:基频相同,泛音比例可以不同

前天 3阅读

想给原创桌面小动画配两种电子音,可以先让AI提供成分清楚的声音配方。我们把音高基准、时长和响起方式固定,只改变几个正弦成分的相对强弱,就能比较声音内部结构。本文交付的是可输入合成器的参数草案,没有把文字推演写成已经听过的音频。

让 AI 配一组加法合成音色:基频相同,泛音比例可以不同

AI生成概念插图:几个简单波形成分汇入复合声音;波形和谱线仅表意,不是正文配方的测量截图。

先约定三个振荡器做什么

原创输入是200、400、600赫兹三个正弦振荡器,每个声音持续一秒,初始相位都为零。配方甲的线性振幅分别为0.60、0.15、0.05;配方乙分别为0.40、0.25、0.15。这里的数是线性振幅,不是分贝,也不是三只音量旋钮的百分比刻度,软件若用别的单位,需要先换算。

哥伦比亚大学的电子音乐教材说明,加法合成通过相加较简单的声音构造复合音,并可分别控制成分的频率与振幅。本例三个频率是200的1、2、3倍,因此属于同一谐波序列。改变第二、第三成分的比例,会改变合成波形;不必先把它描述成某种真实乐器。

请AI交两种比例,而不是两个形容词

甲的相对振幅比是12比3比1,基频更突出;乙为8比5比3,较高成分占比增加。可以把乙“可能显得更明亮”作为试听问题,却不能把明亮等同于更响。两组振幅之和虽然都是0.80,能量分布不同,实际感受到的响度也不能由这个总和保证相同。

手算可核对周期:200赫兹每5毫秒重复一次;在同样5毫秒内,400和600赫兹分别完成两次、三次。三个成分会共同回到原相位。另一个检查是绝对值上界:每个正弦最多贡献自己的振幅,三项总和不超过0.80。这是保守峰值上界,并非声称波形一定达到0.80。

完整提示与可执行的试听次序

“为原创动画设计两个一秒的加法合成音。三个正弦频率固定200、400、600赫兹,初相位零。甲振幅0.60、0.15、0.05;乙0.40、0.25、0.15,均为线性值。列频率倍数、最简振幅比、共同周期和绝对值上界,说明能推断什么、哪些必须试听。提出保持时间包络与播放设备相同的比较步骤,不假装生成或播放过音频。”

实际搭建时,先只开200赫兹,确认基础音,再依次加入另外两项。两版沿用同样的短淡入、淡出和总时长,避免起止点击声掩盖差别。最后以舒适的小音量切换两版,记录“更薄、更亮或差异不明显”等听感;若调节整体音量,也把调节量记下来。

AI若把400赫兹换成450赫兹来制造新感觉,就同时改变了谐波关系,已不是本轮比较。三条稳态成分也不足以复刻木笛、钟或人声的细节。先保留这份小配方的可核查性,再逐项增加噪声、动态变化或更多成分,才知道每个修改到底带来了什么。

参考资料

Columbia University:Music and Computers,Additive Synthesis

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。