“Tacotron: A fully end-to-end text-to-speech synthesis model,”
Original
Yuxuan Wang, RJ Skerry-Ryan, Daisy Stanton, Yonghui Wu, Ron J Weiss, Navdeep Jaitly, Zongheng Yang, Ying Xiao, Zhifeng Chen, Samy Bengio, et al., · 2017
Cited alongside, same era.
“Natural tts synthesis by conditioning wavenet on mel spectrogram predictions,”
Original
Jonathan Shen, Ruoming Pang, Ron J Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, RJ Skerry-Ryan, et al., · 2017
Cited alongside, same era.
“Deep voice: Real-time neural text-to-speech,”
Original
Sercan O Arik, Mike Chrzanowski, Adam Coates, Gregory Diamos, Andrew Gibiansky, Yongguo Kang, Xian Li, John Miller, Andrew Ng, Jonathan Raiman, et al., · 2017
Cited alongside, same era.
“The LJ speech dataset,” 2017
Keith Ito et al., · 2017
Cited alongside, same era.
“Deep voice 2: Multi-speaker neural text-to-speech,”
Original
Sercan Arik, Gregory Diamos, Andrew Gibiansky, John Miller, Kainan Peng, Wei Ping, Jonathan Raiman, and Yanqi Zhou, · 2017
Cited alongside, same era.
“Glow: Generative flow with invertible 1x1 convolutions,”
Original
Diederik P Kingma and Prafulla Dhariwal, · 2018
Cited alongside, same era.
“Waveglow,” https://nv-adlr.github.io/WaveGlow , 2018
Ryan Prenger and Rafael Valle, · 2018
Cited alongside, same era.