Fetching the paper…
Reading the bibliography…
End-to-end (E2E) models fold the acoustic, pronunciation and language models of a conventional speech recognition model into one neural network with a much smaller number of parameters than a conventional ASR system, thus making it suitable for on-device applications.
“Lattice-based optimization of sequence classification criteria for neural-network acoustic modeling,”
Brian Kingsbury, · 2009
Earlier work this paper cites.
“Sequence Transduction with Recurrent Neural Networks,”
Alex Graves, · 2012
Earlier work this paper cites.
“Sequence-discriminative training of deep neural networks,”
Karel Veselỳ, Arnab Ghoshal, Lukas Burget, and Daniel Povey, · 2013
Earlier work this paper cites.
“Towards end-to-end speech recognition with recurrent neural networks,”
Alex Graves and Navdeep Jaitly, · 2014
Earlier work this paper cites.
William Chan, Navdeep Jaitly, Quoc V. Le, and Oriol Vinyals, · 2015
Earlier work this paper cites.
“Attention-based models for speech recognition,”
Jan Chorowski, Dzmitry Bahdanau, Dmitriy Serdyuk, Kyunghyun Cho, and Yoshua Bengio, · 2015
Earlier work this paper cites.
“Towards better decoding and language model integration in sequence to sequence models,”
Jan Chorowski and Navdeep Jaitly, · 2016
Earlier work this paper cites.
“Lower frame rate neural network acoustic models,”
Golan Pundak and Tara N. Sainath, · 2016
Earlier work this paper cites.
“Exploring architectures, data and units for streaming end-to-end speech recognition with RNN-transducer,”
Kanishka Rao, Hasim Sak, and Rohit Prabhavalkar, · 2017
Earlier work this paper cites.
“Joint CTC-attention based end-to-end speech recognition using multi-task learning,”
Suyoun Kim, Takaaki Hori, and Shinji Watanabe, · 2017
Cited alongside, same era.
“Endpoint Detection Using Grid Long Short-Term Memory Networks for Streaming Speech Recognition,”
Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Gabor Simko, and Carolina Parada, · 2017
Cited alongside, same era.
“Improved end-of-query detection for streaming speech recognition,”
Matt Shannon, Gabor Simko, Shuo-Yiin Chang, and Carolina Parada, · 2017
Cited alongside, same era.
“Generation of large-scale simulated utterances in virtual rooms to train deep-neural networks for far-field speech recognition in Google Home,”
Chanwoo Kim, Ananya Misra, Kean Chin, Thad Hughes, Arun Narayanan, Tara N. Sainath, and Michiel Bacchiani, · 2017
Cited alongside, same era.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin, · 2017
Cited alongside, same era.
“Multi-dialect speech recognition with a single sequence-to-sequence model,”
Bo Li, Tara N Sainath, Khe Chai Sim, Michiel Bacchiani, Eugene Weinstein, Patrick Nguyen, Zhifeng Chen, Yanghui Wu, and Kanishka Rao, · 2018
Later among the works it cites.
“Streaming End-to-end Speech Recognition For Mobile Devices,”
Yanzhang He, Tara N. Sainath, Rohit Prabhavalkar, Ian McGraw, Raziel Alvarez, Ding Zhao, David Rybach, Anjuli Kannan, Yonghui Wu, Ruoming Pang, Qiao Liang, Deepti Bhatia, Yuan Shangguan, Bo Li, Golan Pundak, Khe Chai Sim, Tom Bagby, Shuo-Yiin Chang, Kanishka Rao, and Alexander Gruenstein, · 2019
Later among the works it cites.
“Joint Endpointing and Decoding with End-to-end Models,”
Shuo-Yiin Chang, Rohit Prabhavalkar, Yanzhang He, Tara N. Sainath, and Gabor Simko, · 2019
Later among the works it cites.
“Two-Pass End-to-End Speech Recognition,”
Tara N. Sainath, Ruoming Pang, David Rybach, Yanzhang He, Rohit Prabhavalkar, Wei Li, Mirko Visontai, Qiao Liang, Trevor Strohman, Yonghui Wu, Ian McGraw, and Chung-Cheng Chiu, · 2019
Later among the works it cites.
“RWTH ASR systems for LibriSpeech: Hybrid vs Attention,”
Christoph Lüscher, Eugen Beck, Kazuki Irie, Markus Kitza, Wilfried Michel, Albert Zeyer, Ralf Schlüter, and Hermann Ney, · 2019
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models,”
Rohit Prabhavalkar, Tara N. Sainath, Yonghui Wu, Patrick Nguyen, Zhifeng Chen, Chung-Cheng Chiu, and Anjuli Kannan, · 2018
Cited alongside, same era.
“State-of-the-art Speech Recognition With Sequence-to-Sequence Models,”
Chung-Cheng Chiu, Tara N. Sainath, Yonghui Wu, Rohit Prabhavalkar, Patrick Nguyen, Zhifeng Chen, Anjuli Kannan, Ron J. Weiss, Kanishka Rao, Navdeep Jaitly, Bo Li, Jan Chorowski, and Michiel Bacchiani, · 2018
Cited alongside, same era.
“Temporal modeling using dilated convolution and gating for voice-activity-detection,”
Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Gabor Simko, Anshuman Tripath, Aaron van den Oord, and Oriol Vinyals, · 2018
Cited alongside, same era.
“Toward domain-invariant speech recognition via large scale training,”
Arun Narayanan, Ananya Misra, Khe Chai Sim, Golan Pundak, Anshuman Tripathi, Mohamed Elfeky, Parisa Haghani, Trevor Strohman, and Michiel Bacchiani, · 2018
Cited alongside, same era.
Later among the works it cites.
“Online Hybrid CTC/Attention Architecture for End-to-End Speech Recognition,”
Haoran Miao, Gaofeng Cheng, Pengyuan Zhang, Ta Li, and Yonghong Yan, · 2019
Later among the works it cites.
“A unified endpointer using multitask and multidomain training,”
Shuo-Yiin Chang, Bo Li, and Gabor Simko, · 2019
Later among the works it cites.
“Lingvo: a modular and scalable framework for sequence-to-sequence modeling,”
Jonathan Shen, Patrick Nguyen, Yonghui Wu, Zhifeng Chen, et al., · 2019
Later among the works it cites.