Fetching the paper…
Reading the bibliography…
This paper investigates the applications of various multilingual approaches developed in conventional hidden Markov model (HMM) systems to sequence-to-sequence (seq2seq) automatic speech recognition (ASR).
“Bidirectional recurrent neural networks,”
Mike Schuster and Kuldip K Paliwal, · 1997
Earlier work this paper cites.
“Long short-term memory,”
Sepp Hochreiter and Jürgen Schmidhuber, · 1997
Earlier work this paper cites.
“The Kaldi speech recognition toolkit,”
Daniel Povey, Arnab Ghoshal, Gilles Boulianne, Lukas Burget, Ondrej Glembek, Nagendra Goel, Mirko Hannemann, Petr Motlicek, Yanmin Qian, Petr Schwarz, et al., · 2011
Earlier work this paper cites.
“Convolutive bottleneck network features for LVCSR,”
Karel Veselý, Martin Karafiát, and František Grézl, · 2011
Earlier work this paper cites.
“Supervised sequence labelling,”
Alex Graves, · 2012
Earlier work this paper cites.
“The language-independent bottleneck features,”
Karel Veselý, Martin Karafiát, František Grézl, Miloš Janda, and Ekaterina Egorova, · 2012
Earlier work this paper cites.
“Sequence to sequence learning with neural networks,”
Ilya Sutskever, Oriol Vinyals, and Quoc V Le, · 2014
Earlier work this paper cites.
“Neural machine translation by jointly learning to align and translate,”
Dzmitry Bahdanau, Kyunghyun Cho, and Yoshua Bengio, · 2014
Earlier work this paper cites.
“Learning phrase representations using RNN encoder-decoder for statistical machine translation,”
Kyunghyun Cho, Bart Van Merriënboer, Caglar Gulcehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio, · 2014
Earlier work this paper cites.
“Towards end-to-end speech recognition with recurrent neural networks.,”
Alex Graves and Navdeep Jaitly, · 2014
Earlier work this paper cites.
“Learning hidden unit contributions for unsupervised speaker adaptation of neural network acoustic models,”
Pawel Swietojanski and Steve Renals, · 2014
Earlier work this paper cites.
“Multilingual mrasta features for low-resource keyword search and speech recognition systems,”
Zoltan Tuske, David Nolden, Ralf Schluter, and Hermann Ney, · 2014
Cited alongside, same era.
“BUT 2014 Babel system: Analysis of adaptation in NN based systems,”
Martin Karafiát, František Grézl, Mirko Hannemann, Karel Veselý, Igor Szoke, and Jan ”Honza” Černocký, · 2014
Cited alongside, same era.
“An introduction to computational networks and the computational network toolkit,”
Amit Agarwal et al., · 2014
Cited alongside, same era.
“Attention-based models for speech recognition,”
Jan K Chorowski, Dzmitry Bahdanau, Dmitriy Serdyuk, Kyunghyun Cho, and Yoshua Bengio, · 2015
Cited alongside, same era.
“Attention-based models for speech recognition,”
Jan Chorowski, Dzmitry Bahdanau, Dmitriy Serdyuk, Kyunghyun Cho, and Yoshua Bengio, · 2015
Cited alongside, same era.
“Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,”
“Language adaptive multilingual CTC speech recognition,”
Markus Müller, Sebastian Stüker, and Alex Waibel, · 2017
Later among the works it cites.
“Language independent end-to-end architecture for joint language identification and speech recognition,”
Shinji Watanabe, Takaaki Hori, and John R Hershey, · 2017
Later among the works it cites.
“Hybrid CTC/attention architecture for end-to-end speech recognition,”
Shinji Watanabe, Takaaki Hori, Suyoun Kim, John R Hershey, and Tomoki Hayashi, · 2017
Later among the works it cites.
“Monotonic chunkwise attention,”
Chung-Cheng Chiu and Colin Raffel, · 2017
Later among the works it cites.
“Sequence-based multi-lingual low resource speech recognition,”
Siddharth Dalmia, Ramon Sanabria, Florian Metze, and Alan W. Black, · 2018
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
William Chan, Navdeep Jaitly, Quoc Le, and Oriol Vinyals, · 2016
Cited alongside, same era.
“Multilingual blstm and speaker-specific vector adaptation in 2016 BUT Babel system,”
Martin Karafiát, Murali Karthick Baskar, Pavel Matějka, Karel Veselỳ, František Grézl, and Jan Černocky, · 2016
Cited alongside, same era.
“Multilingual blstm and speaker-specific vector adaptation in 2016 but babel system,”
Martin Karafiát, K. Murali Baskar, Pavel Matějka, Karel Veselý, František Grézl, and Jan Černocký, · 2016
Cited alongside, same era.
“End-to-end speech recognition and keyword search on low-resource languages,”
Andrew Rosenberg, Kartik Audhkhasi, Abhinav Sethy, Bhuvana Ramabhadran, and Michael Picheny, · 2017
Cited alongside, same era.
“An investigation of deep neural networks for multilingual speech recognition training and adaptation,”
Sibo Tong, Philip N Garner, and Hervé Bourlard, · 2017
Cited alongside, same era.
“Multilingual training and cross-lingual adaptation on CTC-based acoustic model,”
Sibo Tong, Philip N Garner, and Hervé Bourlard, · 2017
Cited alongside, same era.
Shubham Toshniwal, Tara N Sainath, Ron J Weiss, Bo Li, Pedro Moreno, Eugene Weinstein, and Kanishka Rao, · 2018
Closest in time.
“Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling,”
Jaejin Cho, Murali Karthick Baskar, Ruizhi Li, Matthew Wiesner, Sri Harish Mallidi, Nelson Yalta, Martin Karafiat, Shinji Watanabe, and Takaaki Hori, · 2018
Closest in time.
“Self-attentional acoustic models,”
Matthias Sperber, Jan Niehues, Graham Neubig, Sebastian Stüker, and Alex Waibel, · 2018
Closest in time.
“ESPnet: End-to-end speech processing toolkit,”
Shinji Watanabe, Takaaki Hori, Shigeki Karita, Tomoki Hayashi, Jiro Nishitoba, Yuya Unno, Nelson Enrique Yalta Soplin, Jahn Heymann, Matthew Wiesner, Nanxin Chen, et al., · 2018
Closest in time.
“Towards language-universal end-to-end speech recognition,”
Suyoun Kim and Michael L. Seltzer, · 2018
Closest in time.