声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法。如有转载,请标注来源。

 

欢迎关注微信公众号:低调奋进

XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System

本篇文章是亚洲微软在2020.06.11更新的文章,主要是研究小冰唱歌系统,具体的链接 https://arxiv.org/pdf/2006.06261.pdf

1 背景

歌唱合成和普通的语音合成有许多不同,歌唱合成具有更丰富的频率变化。本文设计了高质量的歌唱合成xiaoicesing系统,使合成的歌唱更自然,具体的demo链接 https://xiaoicesing.github.io/ (另一篇文章hifisinger的效果比这篇好很多,音质方面更多与声码器有关)

2 详细的系统

本文使用的系统架构是fastspeech,声码器为world vocoder,具体为图1所示。该系统主要注意的几点。第一,输入的内容是从乐谱中提取的phoneme, pitch和duration,具体的格式为图二。第二,encoder和decoder之间的durtion训练时候不仅考虑phoneme的loss,也考虑syllable的loss,因此此处的loss为公式1。第三,decoder输出的特征mgc+bap+v/uv+pitch,其中pitch使用残差的方式进行拼接,其loss为公式2和3。

3 实验

此处baseline系统为CNN的声学模型+LSTM的f0和duration。由table1的mos结果显示,xiaoicesing在pronun acc. sound quality和naturalness都是远远好于baseline。客观指标table2 显示错误率指标RMSE,xiaoicesing低于baseline,相关性corr 指标xiaoicesing高于baseline,其它参数也是好于baseline。

接下来图3显示ave gv实验,xiaoicesing更贴近原始音频,图4展示xiaoice的语谱图刻画的频率更好。

ab test结果如图5 显示,基频f0和durtion远远好于baseline系统。图6和图7也显示f0和durtion的测试中,xiaoicesing更贴切原始音频。

4 总结

本文设计了高质量的歌唱合成xiaoicesing系统,使合成的歌唱更自然。(
奈何手中没有语料,只能做技术储备)

更多推荐