Fetching the paper…
Reading the bibliography…
End-to-end automatic speech recognition (ASR) and large language models, such as Whisper and GPT-2, have recently been scaled to use vast amounts of training data.
“Get to the point: summarization with pointer-generator networks”,
A. See, P. J. Liu & C. D. Manning, · 2017
Earlier work this paper cites.
“Attention is all you need”,
A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser & I. Polosukhin, · 2017
Earlier work this paper cites.
Improving language understanding by generative pre-training,
A. Radford, K. Narasimhan, T. Salimans and I.Sutskever, · 2018
Earlier work this paper cites.
“Contextual speech recognition in end-to-end neural network systems using beam search”,
I. Williams, A. Kannan, P. Aleksic, D. Rybach & T. Sainath, · 2018
Earlier work this paper cites.
“Deep context: End-to-end contextual speech recognition”,
G. Pundak, T. Sainath, R. Prabhavalkar, A. Kannan & D. Zhao, · 2018
Earlier work this paper cites.
“Language Models are Unsupervised Multitask Learners”,
A. Radford, J. Wu, R. Child, D. Luan, D. Amodei & I. Sutskever, · 2019
Earlier work this paper cites.
“Shallow-fusion end-to-end contextual biasing”,
D. Zhao, T. Sainath, D. Rybach, P. Rondon, D. Bhatia, B. Li & R. Pang, · 2019
Earlier work this paper cites.
“Joint grapheme and phoneme embeddings for contextual end-to-end ASR”,
Z. Chen, M. Jain, Y. Wang, M. L. Seltzer & C. Fuegen, · 2019
Earlier work this paper cites.
“Contextual speech recognition with difficult negative training examples”,
U. Alon, G. Pundak & T. Sainath, · 2019
Earlier work this paper cites.
“End-to-end contextual speech recognition using class language models and a token passing decoder”,
Z. Chen, M. Jain, Y. Wang, M. Seltzer & C. Fuegen, · 2019
Cited alongside, same era.
“Contextual RNN-T for open domain ASR”,
M. Jain, G. Keren, J. Mahadeokar, G. Zweig, F. Metze & Y. Saraf, · 2020
Cited alongside, same era.
“An empirical study of transformer-based neural language model adaptation”
K. Li, Z. Liu, T. He, H. Huang, F. Peng, D. Povey & S. Khudanpur, · 2020
Cited alongside, same era.
“SLURP: A spoken language understanding resource package”,
E. Bastianelli, A. Vanzo, P. Swietojanski & V. Rieser, · 2020
Cited alongside, same era.
“Deep shallow fusion for RNN-T personalization”,
D. Le, G. Keren, J. Chan, J. Mahadeokar, C. Fuegen & M. L. Seltzer, · 2021
Cited alongside, same era.
“Contextualized streaming end-to-end speech recognition with trie-based deep biasing and shallow fusion”,
“Internal language model estimation for domain-adaptive end-to-end speech recognition”
Z. Meng, S. Parthasarathy, E. Sun, Y. Gaur, N. Kanda, L. Lu, X. Chen, R. Zhao, J. Li & Y. Gong, · 2021
Later among the works it cites.
“Robust speech recognition via large-scale weak supervision”,
A. Radford, J.W. Kim, T. Xu, G. Brockman, C. McLeavey & I. Sutskever, · 2022
Later among the works it cites.
“Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition”,
G. Sun, C. Zhang & P. C. Woodland, · 2022
Later among the works it cites.
“Towards Contextual Spelling Correction for Customization of End-to-End Speech Recognition Systems”,
X. Wang, Y. Liu, J. Li, V. Miljanic, S. Zhao & H. Khalil, · 2022
Later among the works it cites.
“Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition”,
G. Sun, C. Zhang & P. C. Woodland, · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
D. Le, M. Jain, G. Keren, S. Kim, Y. Shi, J. Mahadeokar, J. Chan, Y. Shangguan, C. Fuegen, O. Kalinli, Y. Saraf & M. L. Seltzer, · 2021
Cited alongside, same era.
“Tree-constrained pointer generator for end-to-end contextual speech recognition”,
G. Sun, C. Zhang & P. C. Woodland, · 2021
Cited alongside, same era.
“Instant one-shot word-learning for context-specific neural sequence-to-sequence speech recognition”,
C. Huber, J. Hussain, S. Stüker & A. Waibel, · 2021
Cited alongside, same era.
“Adapting GPT, GPT-2 and BERT language models for speech recognition”
X. Zheng, C. Zhang & P. C. Woodland, · 2021
Cited alongside, same era.
A. Radford and J. Kim and T.Xu and G. Brockman C.McLeavey & I. Sutskever, · 2022
Later among the works it cites.
“wav2vec 2.0: A framework for self-supervised learning of speech representations”,
A. Baevski, Y. Zhou, A. Mohamed & M. Auli, · 2023
Closest in time.
“End-to-end Spoken Language Understanding with Tree-constrained Pointer Generator”,
G. Sun, C. Zhang & P. C. Woodland, · 2023
Closest in time.
“Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages”,
Y. Zhang, W. Han, J. Qin, Y. Wang, A. Bapna, Z. Chen, N. Chen, B. Li, V. Axelrod, G. Wang, Z. Meng, K. Hu, A. Rosenberg, R. Prabhavalkar, D.S. Park, P. Haghani, J. Riesa, G. Perng, H. Soltau, T. Strohman, B. Ramabhadran, T. Sainath, P. Moreno, C.-C. Chiu, J. Schalkwyk, F. Beaufays, & Y. Wu., · 2023
Closest in time.