正弦波合成
正弦波合成()是一种用纯音代替共振峰的语音合成方法。哈斯金斯实验室的于1970年代开发了第一个正弦波合成程序,用于自动创建感知实验的刺激物。随后,、魯賓、大衛·皮索尼(David Pisoni)及其他同事利用该程序证明,听者可以在没有传统语音线索(音高、重音和语气)时感知连续语音。这项研究说明,可将语音看做通过发音-声学空间的轨迹的动态模式。 书目 Rubin, P.E. Sinewave synthesis. Internal mem…
共 3 篇文章
正弦波合成()是一种用纯音代替共振峰的语音合成方法。哈斯金斯实验室的于1970年代开发了第一个正弦波合成程序,用于自动创建感知实验的刺激物。随后,、魯賓、大衛·皮索尼(David Pisoni)及其他同事利用该程序证明,听者可以在没有传统语音线索(音高、重音和语气)时感知连续语音。这项研究说明,可将语音看做通过发音-声学空间的轨迹的动态模式。 书目 Rubin, P.E. Sinewave synthesis. Internal mem…
源-滤波器模型将语音表示为生源(如声带)和线性声滤波器(声道)的组合。虽然这只是近似,但由于其相对简单,被广泛用于语音合成与分析等多个领域。它还与线性预测有关。该模型的发展在很大程度上要归功于Gunnar Fant、Ken Stevens等人,他们对语音声学分析和语音合成的基础模型做出了重大贡献。千葉勉和梶山正登首次提出了元音的语言声学特征与声道形状之间的关系,Fant的成果正是建立在他们的研究之上。 应用 不同音素可在不同程度上根据声…
深度学习语音合成用深度神经网络(DNN)从文本(TTS)或频谱(声码器)生成人工语音。DNN使用大量录制语音进行训练,若是TTS系统,则要使用相关标签和/或输入文本。 有些基于DNN的语音合成器已经接近人声的自然度。 表述 给定输入文本或语言单位序列Y,目标语音X可如下求得 X=\arg\max P(X|Y, \theta) 其中\theta是模型参数。 一般来说输入文本会先传给声学特征生成器,声学特征再传给神经声码器。对前者,损失函数…