“Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,”
Alex Graves, Santiago Fernández, Faustino Gomez, and Jürgen Schmidhuber, · 2006
Earlier work this paper cites.
“Deep neural network features and semi-supervised training for low resource speech recognition,”
Samuel Thomas, Michael L Seltzer, Kenneth Church, and Hynek Hermansky, · 2013
Earlier work this paper cites.
“Adam: A method for stochastic optimization,”
Original
Diederik P Kingma and Jimmy Ba, · 2014
Earlier work this paper cites.
“Librispeech: an asr corpus based on public domain audio books,”
Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur, · 2015
Earlier work this paper cites.
“Speech enhancement and recognition using multi-task learning of long short-term memory recurrent neural networks,”
Zhuo Chen, Shinji Watanabe, Hakan Erdogan, and John R Hershey, · 2015
Earlier work this paper cites.
“Deep speech 2: End-to-end speech recognition in english and mandarin,”
Dario Amodei, Sundaram Ananthanarayanan, Rishita Anubhai, Jingliang Bai, Eric Battenberg, Carl Case, Jared Casper, Bryan Catanzaro, Qiang Cheng, Guoliang Chen, et al., · 2016
Earlier work this paper cites.
“Adversarial multi-task learning of deep neural networks for robust speech recognition.,”
Yusuke Shinohara, · 2016
Earlier work this paper cites.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin, · 2017
Earlier work this paper cites.
“Joint ctc-attention based end-to-end speech recognition using multi-task learning,”
Suyoun Kim, Takaaki Hori, and Shinji Watanabe, · 2017
Earlier work this paper cites.