本技术涉及多媒体内容处理的,具体地涉及一种语音转换模型训练方法、语音转换方法、电子设备及存储介质。
背景技术:
1、语音转换(voice conversion,vc)技术在语音助手、聊天机器人、有声书、虚拟人等领域具有广泛应用。随着个性化语音需求的增长,如转换成特定主播或明星音色的声音的需求增长,这一技术的重要性日益显著。
2、当前的语音转换通常包括两个主要部分:声学模型(acoustic model,am)和声码器(vocoder)。声学模型负责根据输入的内容音频及目标音色音频输出梅尔频谱,而声码器则根据梅尔频谱合成相应的音频波形。
3、然而,当前的语音转换技术仍存在一些局限性。例如,传统的语音转换方案中,声码器的参与导致了生成效率的降低和机器学习训练成本的大幅度增加。此外,这些方案在特定音色的精确复制方面往往效果有限,尤其是在面对个性化语音转化的需求时。
4、鉴于上述局限性,希望探索更高效、成本更低的解决方案,提高语音转换的生成效率,降低机器学习训练成本,同时提升个性化语音的准确性和自然性。
5、本背景技术描述的内容仅为了便于了解本领域的相关技术,不视作对现有技术的承认。
技术实现思路
1、因此,本技术实施例意图提供一种语音转换模型训练方法、语音转换方法以及相关的电子设备及存储介质。通过本技术实施例的方案,可以提高语音转换的生成效率,降低机器学习训练成本,同时提升个性化语音的准确性和自然性。
2、第一方面,本技术实施例提供了一种语音转换模型训练方法,所述语音转换模型包括内容编码器、人声编码器以及波形生成器。在该实施例中,所述训练方法包括:
3、预训练所述内容编码器;
4、预训练所述人声编码器;以及
5、对抗训练所述语音转换模型的所述波形生成器和对应的判别器,所述对抗训练包括迭代执行下述步骤,直至达到预设的迭代终止条件:
6、将训练音频分别输入所述内容编码器和人声编码器以输出内容特征和人声特征;
7、将所述内容特征和人声特征输入所述波形生成器,生成训练生成音频,
8、由所述判别器在所述训练音频和所述训练生成音频中判别真实音频和/或生成音频;
9、由根据判别结果的第一相关性确定的第一损失值更新所述波形生成器的参数;
10、由根据判别结果的第二相关性确定的第二损失值更新所述判别器的参数。
11、在本技术实施例中,在迭代执行所述对抗训练时,所述内容编码器和人声编码器的参数保持固定不变。
12、在本技术实施例中,所述对抗训练还包括:
13、将所述训练生成音频输入所述内容编码器得到生成内容特征;
14、根据所述内容特征和所述生成内容特征确定第三损失值;
15、其中,由根据判别结果的第一相关性确定的第一损失值更新所述波形生成器的参数,包括:
16、由所述第一损失值和所述第三损失值更新所述波形生成器的参数。
17、在本技术实施例中,所述对抗训练还包括:
18、将所述训练生成音频输入所述人声编码器得到生成人声特征;
19、根据所述人声特征和所述生成人声特征确定第四损失值;
20、其中,由根据判别结果的第一相关性确定的第一损失值更新所述波形生成器的参数,包括:
21、由所述第一损失值和所述第四损失值更新所述波形生成器的参数。
22、在本技术实施例中,所述对抗训练还包括:
23、将所述训练生成音频输入所述内容编码器得到生成内容特征;
24、根据所述内容特征和所述生成内容特征确定第三损失值;
25、将所述训练生成音频输入所述人声编码器得到生成人声特征;
26、根据所述人声特征和所述生成人声特征确定第四损失值;
27、其中,由根据判别结果的第一相关性确定的第一损失值更新所述波形生成器的参数,包括:
28、由所述第一损失值、第三损失值和所述第四损失值更新所述波形生成器的参数。
29、在本技术实施例中,所述内容编码器为注意力增强内容编码器,包括:采样层,用于对输入的音频特征进行采样以获得下采样的特征序列;一个或多个多头注意力模块,用于基于注意力获取输入的特征序列中的特征关联关系;以及解码器,用于对所述特征序列进行解码以获取音频每一帧的音素后验概率。
30、在本技术实施例中,所述人声编码器为注意力增强人声编码器,包括:特征提取层,用于提取输入音频特征;一个或多个挤压激励残差网络块,用于增强提取的输入音频特征中的给定人声特征;以及输出分类层,用于输出给定人声特征的分类。
31、在本技术实施例中,所述人声特征包括说话人音色特征序列,和/或,所述内容特征包括音素后验概率。
32、在本技术实施例中,在将所述内容特征和人声特征输入所述波形生成器之前,所述对抗训练还包括:拼接所述内容特征和所述人声特征。
33、第二方面,本技术实施例提供了一种语音转换方法,其可包括:
34、将目标内容音频输入语音转换模型的内容编码器以输出目标内容特征,所述语音转换模型是执行如本技术任一实施例所述的方法得到的;
35、将目标人声音频输入所述语音转换模型的人声编码器以输出目标人声特征;以及
36、将所述目标内容特征和目标人声特征输入所述语音转换模型的波形生成器,生成目标生成音频。
37、在本技术实施例中,在将所述目标内容特征和目标人声特征输入所述语音转换模型的波形生成器之前,所述方法还包括:
38、拼接所述目标内容特征和所述目标人声特征。
39、第三方面,本技术实施例提供一种语音转换模型,其包括内容编码器、人声编码器以及波形生成器,其中所述语音转换模型由任一本技术实施例所述的训练方法训练得到。
40、第四方面,本技术实施例提供一种计算机可读存储介质,其上存储有计算机程序,其中,所述程序被处理器执行时,实现任一本技术实施例的方法。
41、第五方面,本技术实施例提供一种电子设备,包括:处理器和存储有计算机程序的存储器,所述处理器被配置为在运行计算机程序时执行任一本技术实施例的方法。
42、本技术方案提供了包括声编码器、内容编码器和波形生成器的语音转换模型的训练方法,包括预训练内容编码器;预训练人声编码器;以及对抗训练语音转换模型的波形生成器和对应的判别器,对抗训练包括迭代执行下述步骤,直至达到预设的迭代终止条件:将训练音频分别输入内容编码器和人声编码器以输出内容特征和人声特征;将内容特征和人声特征输入波形生成器,生成训练生成音频,由判别器在训练音频和训练生成音频中判别真实音频和/或生成音频;由第一损失值更新波形生成器的参数;由第二损失值更新判别器的参数,由此获得的语音转换模型提高了语音转换的生成效率,降低了机器学习训练成本,同时提升了个性化语音的准确性和自然性。
43、本技术实施例的其他可选特征和技术效果一部分在下文描述,一部分可通过阅读本文而明白。
1.一种语音转换模型训练方法,其特征在于,所述语音转换模型包括内容编码器、人声编码器以及波形生成器;
2.根据权利要求1所述的方法,其特征在于,在迭代执行所述对抗训练时,所述内容编码器和人声编码器的参数保持固定不变。
3.根据权利要求1或2所述的方法,其特征在于,所述对抗训练还包括:
4.根据权利要求1或2所述的方法,其特征在于,所述对抗训练还包括:
5.根据权利要求1或2所述的方法,其特征在于,所述对抗训练还包括:
6.根据权利要求1或2所述的方法,其特征在于,所述内容编码器为注意力增强内容编码器,包括:
7.根据权利要求1或2所述的方法,其特征在于,所述人声编码器为注意力增强人声编码器,包括:
8.根据权利要求1或2所述的方法,其特征在于,所述人声特征包括说话人音色特征序列,和/或,所述内容特征包括音素后验概率。
9.根据权利要求1或2所述的方法,其特征在于,在将所述内容特征和人声特征输入所述波形生成器之前,所述对抗训练还包括:拼接所述内容特征和所述人声特征。
10.一种语音转换方法,其特征在于,包括:
11.根据权利要求10所述的方法,其特征在于,在将所述目标内容特征和目标人声特征输入所述语音转换模型的波形生成器之前,所述方法还包括:
12.一种语音转换模型,其特征在于,包括内容编码器、人声编码器以及波形生成器,其中所述语音转换模型由根据权利要求1至9中任一项所述的训练方法训练得到。
13.一种电子设备,其特征在于,包括处理器和存储有计算机程序的存储器,所述处理器被配置为在运行计算机程序时执行权利要求1至11中任一项所述的方法。
14.一种存储介质,其特征在于,所述存储介质存储有计算机程序,所述计算机程序被配置为被运行时执行权利要求1至11中任一项所述的方法。
