Fetching the paper…
Reading the bibliography…
Recently, we made available WeNet, a production-oriented end-to-end speech recognition toolkit, which introduces a unified two-pass (U2) framework and a built-in runtime to address the streaming and non-streaming decoding modes in a single model.
“Phone synchronous decoding with ctc lattice,”
Zhehuai Chen, Wei Deng, Tao Xu, Kai Yu, · 1927
Earlier work this paper cites.
“Finite-state transducers in language and speech processing,”
Mehryar Mohri, · 1997
Earlier work this paper cites.
“Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,”
Alex Graves, Santiago Fernández, Faustino Gomez, Jürgen Schmidhuber, · 2006
Earlier work this paper cites.
“The Kaldi speech recognition toolkit,”
Daniel Povey, Arnab Ghoshal, Gilles Boulianne, Lukáš Burget, Ondřej Glembek, Nagendra Goel, Mirko Hannemann, Petr Motlíček, Yanmin Qian, Petr Schwarz, Jan Silovský, Georg Stemmer, Karel Veselý, · 2011
Earlier work this paper cites.
“Sequence transduction with recurrent neural networks,”
Alex Graves, · 2012
Earlier work this paper cites.
“End-to-end continuous speech recognition using attention-based recurrent nn: First results,”
Jan Chorowski, Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio, · 2014
Earlier work this paper cites.
“Bringing contextual information to google speech recognition,”
Petar Aleksic, Mohammadreza Ghodsi, Assaf Michaely, Cyril Allauzen, Keith Hall, Brian Roark, David Rybach, Pedro Moreno, · 2015
Earlier work this paper cites.
“Librispeech: an asr corpus based on public domain audio books,”
Vassil Panayotov, Guoguo Chen, Daniel Povey, Sanjeev Khudanpur, · 2015
Earlier work this paper cites.
“Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,”
William Chan, Navdeep Jaitly, Quoc Le, Oriol Vinyals, · 2016
Earlier work this paper cites.
“TensorFlow: A system for large-scale machine learning,”
Martín Abadi, Paul Barham, Jianmin Chen, Zhifeng Chen, Andy Davis, Jeffrey Dean, Matthieu Devin, Sanjay Ghemawat, Geoffrey Irving, et al., · 2016
Earlier work this paper cites.
“A comparison of sequence-to-sequence models for speech recognition,”
Rohit Prabhavalkar, Kanishka Rao, Tara N Sainath, Bo Li, Leif Johnson, Navdeep Jaitly, · 2017
Earlier work this paper cites.
“Joint CTC-attention based end-to-end speech recognition using multi-task learning,”
Suyoun Kim, Takaaki Hori, Shinji Watanabe, · 2017
Cited alongside, same era.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, Illia Polosukhin, · 2017
Cited alongside, same era.
“Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline,”
Hui Bu, Jiayu Du, Xingyu Na, Bengu Wu, Hao Zheng, · 2017
Cited alongside, same era.
“ESPnet: End-to-end speech processing toolkit,”
Shinji Watanabe, Takaaki Hori, Shigeki Karita, Tomoki Hayashi, Jiro Nishitoba, Yuya Unno, Nelson Enrique Yalta Soplin, Jahn Heymann, Matthew Wiesner, Nanxin Chen, Adithya Renduchintala, Tsubasa Ochiai, · 2018
Cited alongside, same era.
“Aishell-2: Transforming mandarin asr research into industrial scale,”
Jiayu Du, Xingyu Na, Xuechen Liu, Hui Bu, · 2018
Cited alongside, same era.
“A streaming on-device end-to-end model surpassing server-side conventional model quality and latency,”
Tara N Sainath, Yanzhang He, Bo Li, Arun Narayanan, Ruoming Pang, Antoine Bruguier, et al., · 2020
Later among the works it cites.
“Deliberation model based two-pass end-to-end speech recognition,”
Ke Hu, Tara N Sainath, Ruoming Pang, Rohit Prabhavalkar, · 2020
Later among the works it cites.
“Conformer: Convolution-augmented transformer for speech recognition,”
Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, Ruoming Pang, · 2020
Later among the works it cites.
“Contextual RNN-T for open domain asr,”
Mahaveer Jain, Gil Keren, Jay Mahadeokar, Geoffrey Zweig, Florian Metze, Yatharth Saraf, · 2020
Later among the works it cites.
“WeNet: Production oriented streaming and non-streaming end-to-end speech recognition toolkit,”
Zhuoyuan Yao, Di Wu, Xiong Wang, Binbin Zhang, Fan Yu, Chao Yang, Zhendong Peng, Xiaoyu Chen, Lei Xie, Xin Lei, · 2021
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Exploring rnn-transducer for chinese speech recognition,”
Senmao Wang, Pan Zhou, Wei Chen, Jia Jia, Lei Xie, · 2019
Cited alongside, same era.
“Two-pass end-to-end speech recognition,”
Tara N Sainath, Ruoming Pang, David Rybach, Yanzhang He, Rohit Prabhavalkar, Wei Li, Mirkó Visontai, Qiao Liang, Trevor Strohman, Yonghui Wu, Ian McGraw, Chung-Cheng Chiu, · 2019
Cited alongside, same era.
“Streaming end-to-end speech recognition for mobile devices,”
Yanzhang He, Tara N Sainath, Rohit Prabhavalkar, Ian McGraw, Raziel Alvarez, Ding Zhao, David Rybach, Anjuli Kannan, et al., · 2019
Cited alongside, same era.
“High performance i/o for large scale deep learning,”
Alex Aizman, Gavin Maltby, Thomas Breuel, · 2019
Cited alongside, same era.
“Specaugment: A simple data augmentation method for automatic speech recognition,”
Daniel S Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D Cubuk, Quoc V Le, · 2019
Cited alongside, same era.
“Transformer-based online ctc/attention end-to-end speech recognition architecture,”
Haoran Miao, Gaofeng Cheng, Changfeng Gao, Pengyuan Zhang, Yonghong Yan, · 2020
Cited alongside, same era.
“Cascade rnn-transducer: Syllable based streaming on-device mandarin speech recognition with a syllable-to-character converter,”
Xiong Wang, Zhuoyuan Yao, Xian Shi, Lei Xie, · 2021
Later among the works it cites.
“Simplified self-attention for transformer-based end-to-end speech recognition,”
Haoneng Luo, Shiliang Zhang, Ming Lei, Lei Xie, · 2021
Later among the works it cites.
“Speechbrain: A general-purpose speech toolkit,”
Mirco Ravanelli, Titouan Parcollet, Peter Plantinga, Aku Rouhe, Samuele Cornell, Loren Lugosch, Cem Subakan, Nauman Dawalatabad, et al., · 2021
Later among the works it cites.
“Gigaspeech: An evolving, multi-domain ASR corpus with 10,000 hours of transcribed audio,”
Guoguo Chen, Shuzhou Chai, Guan-Bo Wang, Jiayu Du, Wei-Qiang Zhang, Chao Weng, Dan Su, Daniel Povey, et al., · 2021
Later among the works it cites.
“Recent advances in end-to-end atomatic speech recognition,”
Jinyu Li, · 2022
Closest in time.
“Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition,”
Binbin Zhang, Hang Lv, Pengcheng Guo, Qijie Shao, Chao Yang, Lei Xie, Xin Xu, Hui Bu, Xiaoyu Chen, Chenchen Zeng, et al., · 2022
Closest in time.