标签:#辅助技术

共 1 篇文章

深度学习语音合成

深度学习语音合成用深度神经网络(DNN)从文本(TTS)或频谱(声码器)生成人工语音。DNN使用大量录制语音进行训练,若是TTS系统,则要使用相关标签和/或输入文本。 有些基于DNN的语音合成器已经接近人声的自然度。 表述 给定输入文本或语言单位序列Y,目标语音X可如下求得 X=\arg\max P(X|Y, \theta) 其中\theta是模型参数。 一般来说输入文本会先传给声学特征生成器,声学特征再传给神经声码器。对前者,损失函数…