Speech Recognition for Medical Conversations
Chiu, C.-C., Tripathi, A., Chou, K., Co, C., Jaitly, N., Jaunzeikare, D., Kannan, A., Nguyen, P., Sak, H., Sankar, A., Tansuwan, J., Wan, N., Wu, Y., and Zhang, X · 2018
Cited alongside, same era.
Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
Jia, Y., Zhang, Y., Weiss, R. J., Wang, Q., Shen, J., Ren, F., Chen, Z., Nguyen, P., Pang, R., Lopez-Moreno, I., and Wu, Y · 2018
Cited alongside, same era.
Efficient Neural Audio Synthesis
Kalchbrenner, N., Elsen, E., Simonyan, K., Noury, S., Casagrande, N., Lockhart, E., Stimberg, F., Oord, A. v. d., Dieleman, S., and Kavukcuoglu, K · 2018
Cited alongside, same era.
Deep Voice 3: Scaling text-to-speech with convolutional sequence learning
Ping, W., Peng, K., Gibiansky, A., Arik, S. O., Kannan, A., Narang, S., Raiman, J., and Miller, J · 2018
Cited alongside, same era.
Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
Shen, J., Pang, R., Weiss, R. J., Schuster, M., Jaitly, N., Yang, Z., Chen, Z., Zhang, Y., Wang, Y., Skerrv-Ryan, R., Saurous, R. A., Agiomyrgiannakis, Y., and Wu, Y · 2018
Cited alongside, same era.
Towards End-to-End Prosody Transfer for Expressive Speech Synthesis with Tacotron
Skerry-Ryan, R., Battenberg, E., Xiao, Y., Wang, Y., Stanton, D., Shor, J., Weiss, R., Clark, R., and Saurous, R. A · 2018
Cited alongside, same era.
Forward attention in sequence-to-sequence acoustic modeling for speech synthesis
Zhang, J.-X., Ling, Z.-H., and Dai, L.-R · 2018
Cited alongside, same era.
Parrotron: An End-to-End Speech-to-Speech Conversion Model and its Applications Hearing-Impaired Speech and Speech Separation
Biadsy, F., Weiss, R. J., Moreno, P. J., Kanvesky, D., and Jia, Y · 2019
Cited alongside, same era.
A New GAN-based End-to-End TTS Training Algorithm
Guo, H., Soong, F. K., He, L., and Xie, L · 2019
Cited alongside, same era.
Robust Sequence-to-Sequence Acoustic Modeling with Stepwise Monotonic Attention for Neural TTS
He, M., Deng, Y., and He, L · 2019
Cited alongside, same era.
Direct Speech-to-Speech Translation with a Sequence-to-Sequence Model
Jia, Y., Weiss, R. J., Biadsy, F., Macherey, W., Johnson, M., Chen, Z., and Wu, Y · 2019
Cited alongside, same era.
CHiVE: Varying Prosody in Speech Synthesis with a Linguistically Driven Dynamic Hierarchical Conditional Variational Network
Kenter, T., Wan, V., Chan, C.-A., Clark, R., and Vit, J · 2019
Cited alongside, same era.