人工智能语音克隆在嘈杂环境中往往比它们所模仿的真实人类声音更容易理解。这一发现证明,合成语音技术可以显著改善针对语言障碍人士的辅助沟通设备。该研究发表在《美国声学学会杂志》上。
合成声音越来越多地出现在日常生活中,从Siri和Alexa等数字助手到自动电话推销和答录机。随着生成式人工智能的扩展,语音克隆已成为一种新型合成语音。传统的合成声音需要配音演员在录音室里花费数小时,而人工智能仅需10秒的录音就能生成高度逼真的语音克隆。这种极低的要求极大地扩展了潜在的声音和应用范围。
人们常常担心这项技术带来的社会风险,例如用于欺诈或虚假信息的深度伪造音频。然而,个性化语音合成在医疗和通信方面的潜在益处却较少受到关注。面临帕金森病等退行性疾病或从喉癌中康复的人,往往依赖电脑替他们说话。拥有个性化的合成声音有助于他们保持个人身份。当使用者周围的人能够轻松理解生成的声音时,这些辅助设备才最为有用。
伦敦大学学院的研究人员帕蒂·阿丹克和罗汉普顿大学的研究人员王涵专门研究人们对模糊语音的感知。他们对机器复制的语音感到着迷,并想知道普通人理解这些克隆声音的难易程度。由于说话速度、轻微沙哑或浓重方言等因素,自然声音的可懂度差异很大。研究人员最初怀疑语音克隆会是真实人类声音的拙劣模仿,人们会难以理解它们。
“我起初认为语音克隆可懂度更低,因为它们不熟悉,”阿丹克说。“结果发现它们可懂度高出20%,这非常令人震惊。我们论文的一小部分描述了那个实验,而大部分内容则是我和合作者拼命想找出是什么让这些语音克隆更容易理解。”
为了初步测试这些声音的可懂度,科学家们组织了一项由80名参与者参与的在线实验。样本包括40名男性和40名女性,年龄在18至35岁之间。所有参与者都是居住在英国、以英国英语为母语的人,他们在测试期间佩戴有线耳机以确保最佳音质。
科学家们从一个已有的数据库中提取了来自英格兰不同地区的10个真人声音。他们为每个人提取了大约348秒的语音,然后将这些短音频剪辑输入到ElevenLabs——一个流行的人工智能语音生成程序中。这一过程创建了10个与原始真人说话者完全对应的人工语音克隆。
然后,作者生成了80个不同的测试句子,旨在评估听力和理解力。其中一半句子由原始真人朗读,另一半由人工智能生成。研究人员将所有音频片段与一种名为“语音成形噪声”的背景声音混合。这种噪声类似于连续的静电声,能有效掩盖人声。
背景静电以四个不同的音量水平呈现,范围从比语音更响到比语音更轻。参与者听取句子并打字输入他们听到的准确词语。研究人员对打字回答进行评分,以衡量听者在静电干扰下理解语音的能力。
克隆语音为听者提供了巨大的优势。参与者正确识别人工语音中词语的比例为67.5%。而在听真人声音时,准确率下降到仅54.1%。这个克隆语音13.4个百分点的优势在所有四个背景噪声水平下保持一致。
根据研究随附的新闻稿,二人组在不同群体中重复了该实验,以检验这一优势是否成立。他们测试了老年志愿者,以确定听力不佳是否会改变效果;测试了美国志愿者,以判断英国口音是否起作用;甚至使用了旨在模拟人工耳蜗的滤波器。在每种情况下,语音克隆都胜出。
回到主要研究组,参与者还完成了两项针对声音的主观评分任务。他们在一到七分的量表上评价每个声音的清晰度或铿锵感,并在类似的七分量表上评价每位说话者地方口音的强度。听者判断人工克隆声音比原始真人声音明显更清晰,同时认为克隆声音的地方口音稍强一些。
研究人员还想知道人们能否区分真实声音和人工声音。他们要求参与者听成对的相同句子,并挑出真正的真人声音。听者正确识别真人的比例为70.4%。这表明,尽管人工拷贝具有很高的可懂度,但它们仍然含有略微不自然的特质,让人觉察出是电脑生成的。
为了弄清楚克隆声音为何更容易理解,科学家分析了音频文件的47种不同声学特性。他们使用计算机软件测量了音高、语速和声音谐波丰富度等特征。音高指声音的高低,谐波是赋予声音独特质感和共鸣的重叠频率。
他们观察了特定的声音不稳定性标记,即抖动和闪烁。抖动测量人体呼吸和说话时自然发生的微小、无意的音高变化,闪烁则测量瞬间音量大小的微观变化。分析显示,人工声音缺乏这些自然的微小波动,从而产生了更平滑、更稳定的声音曲线。
统计模型显示出大脑处理两类音频时存在差异。对于真人音频,理解依赖于共振峰测量。共振峰是由人声道物理形状产生的集中声能频带。听者依赖这些物理口型线索来解码人类语言。
对于克隆声音,听者的理解主要依赖于整体音高和平滑的谐波结构。人工智能似乎通过放大声音的广泛结构元素来提高可懂度,它优先考虑这些平滑、稳定的声波,而不是复制原始说话者准确的口部运动。这种声学稳定性可能使人类大脑更容易将声音与背景静电分离。
该研究存在一些局限性,需要未来进一步探索。实验使用了高度结构化、预先写好的句子,这些句子并不模仿自然的日常对话。现实生活中的说话方式随意得多,这可能会改变人工智能捕捉语音模式的效果。作者建议未来的研究应该测试对话式语音,而非朗读句子。
主要实验仅测试了声音对抗一种特定类型的稳态静电噪声。现实环境中包含多种不同类型的听觉干扰。未来研究应评估这些人工拷贝在混有繁忙餐厅声音或多个对话者声音时表现如何。科学家还可以故意操纵人工语音设置,看看添加或去除声音粗糙度是否会改变听者的理解度。
在检查了100多项声学测量以理解可懂度差距之后,阿丹克指出,他们计划与文本转语音专家合作,调整一个开源克隆系统用于未来测试。
“我现在打算研究合成器的工作原理以及它们如何使用数字信号处理来生成那些声音,试图重现(这一效果),以便对这个问题有所把握,”阿丹克说。
这些发现凸显了一个常被称为“恐怖谷”的有趣心理现象。计算机生成的声音在数学上针对易于听清进行了优化,但听者仍然注意到了它们略显人工的特征。随着技术的进步,开发者需要在让声音易于听清和使它们听起来真实自然之间取得平衡。一个完美平滑的声音也许容易理解,但它可能缺乏真实人的情感温度。
这些发现为医疗和辅助技术带来了巨大希望。患有夺走说话能力疾病的人可以利用人工智能储存自己的声音。由此产生的通信设备实际上可能让他们在嘈杂环境中交谈得比原本的物理声音更加轻松。助听器也可以融入这项技术,为佩戴者处理和增强传入的语音。
这项研究题为“语音克隆在噪声中比其真人原声更容易理解:语音克隆可懂度优势”,由帕蒂·阿丹克和王涵撰写。
【全文结束】

