Fetching the paper…
Reading the bibliography…
Despite notable advancements in automatic speech recognition (ASR), performance tends to degrade when faced with adverse conditions.
“Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,”
Alex Graves, Santiago Fernández, Faustino Gomez, and Jürgen Schmidhuber, · 2006
Earlier work this paper cites.
“Learning phrase representations using RNN encoder-decoder for statistical machine translation,”
Kyunghyun Cho, Bart van Merrienboer, Çaglar Gülçehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio, · 2014
Earlier work this paper cites.
“Gaussian error linear units (gelus),”
Dan Hendrycks and Kevin Gimpel, · 2016
Earlier work this paper cites.
“Cold fusion: Training seq2seq models together with language models,”
Anuroop Sriram, Heewoo Jun, Sanjeev Satheesh, and Adam Coates, · 2017
Earlier work this paper cites.
“Attention is all you need,”
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin, · 2017
Earlier work this paper cites.
“An analysis of incorporating an external language model into a sequence-to-sequence model,”
Anjuli Kannan, Yonghui Wu, Patrick Nguyen, Tara N Sainath, Zhijeng Chen, and Rohit Prabhavalkar, · 2018
Earlier work this paper cites.
“Improved Accented Speech Recognition Using Accent Embeddings and Multi-task Learning,”
Abhinav Jain, Minali Upreti, and Preethi Jyothi, · 2018
Earlier work this paper cites.
“Multilingual speech recognition with a single end-to-end model,”
Shubham Toshniwal, Tara N Sainath, Ron J Weiss, Bo Li, Pedro Moreno, Eugene Weinstein, and Kanishka Rao, · 2018
Earlier work this paper cites.
“Component fusion: Learning replaceable language model component for end-to-end speech recognition system,”
Changhao Shan, Chao Weng, Guangsen Wang, Dan Su, Min Luo, Dong Yu, and Lei Xie, · 2019
Earlier work this paper cites.
“Deliberation model based two-pass end-to-end speech recognition,”
Ke Hu, Tara N Sainath, Ruoming Pang, and Rohit Prabhavalkar, · 2020
Earlier work this paper cites.
“Asr error correction and domain adaptation using machine translation,”
Anirudh Mani, Shruti Palaskar, Nimshi Venkat Meripo, Sandeep Konam, and Florian Metze, · 2020
Earlier work this paper cites.
“Dialect-aware modeling for end-to-end Japanese dialect speech recognition,”
Ryo Imaizumi, Ryo Masumura, Sayaka Shiota, and Hitoshi Kiya, · 2020
Cited alongside, same era.
“Conformer: Convolution-augmented Transformer for Speech Recognition,”
Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, and Ruoming Pang, · 2020
Cited alongside, same era.
“Fastcorrect: Fast error correction with edit alignment for automatic speech recognition,”
Yichong Leng, Xu Tan, Linchen Zhu, Jin Xu, Renqian Luo, Linquan Liu, Tao Qin, Xiangyang Li, Edward Lin, and Tie-Yan Liu, · 2021
Cited alongside, same era.
“E2E-Based Multi-Task Learning Approach to Joint Speech and Accent Recognition,”
Jicheng Zhang, Yizhou Peng, Van Tung Pham, Haihua Xu, Hao Huang, and Eng Siong Chng, · 2021
Cited alongside, same era.
“The accented english speech recognition challenge 2020: open datasets, tracks, baselines, results and methods,”
Xian Shi, Fan Yu, Yizhou Lu, Yuhao Liang, Qiangze Feng, Daliang Wang, Yanmin Qian, and Lei Xie, · 2021
Cited alongside, same era.
“Softcorrect: Error correction with soft detection for automatic speech recognition,”
Yichong Leng, Xu Tan, Wenjie Liu, Kaitao Song, Rui Wang, Xiang-Yang Li, Tao Qin, Ed Lin, and Tie-Yan Liu, · 2023
Later among the works it cites.
Rao Ma, Mark JF Gales, Kate M Knill, and Mengjie Qian, · 2023
Later among the works it cites.
“Generative error correction for code-switching speech recognition using large language models,”
Chen Chen, Yuchen Hu, Chao-Han Huck Yang, Hexin Liu, Sabato Marco Siniscalchi, and Eng Siong Chng, · 2023
Later among the works it cites.
“Robust speech recognition via large-scale weak supervision,”
Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever, · 2023
Later among the works it cites.
“Everyone has an accent,”
Nina Markl and Catherine Lai, · 2023
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Kespeech: An open source speech dataset of mandarin and its eight subdialects,”
Zhiyuan Tang, Dong Wang, Yanguang Xu, Jianwei Sun, Xiaoning Lei, Shuaijiang Zhao, Cheng Wen, Xingjun Tan, Chuandong Xie, Shuran Zhou, et al., · 2021
Cited alongside, same era.
“WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit,”
Zhuoyuan Yao, Di Wu, Xiong Wang, Binbin Zhang, Fan Yu, Chao Yang, Zhendong Peng, Xiaoyu Chen, Lei Xie, and Xin Lei, · 2021
Cited alongside, same era.
“Wavlm: Large-scale self-supervised pre-training for full stack speech processing,”
Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al., · 2022
Cited alongside, same era.
“Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition,”
Qijie Shao, Jinghao Yan, Jian Kang, Pengcheng Guo, Xian Shi, Pengfei Hu, and Lei Xie, · 2022
Cited alongside, same era.
“Layer-wise fast adaptation for end-to-end multi-accent speech recognition,”
Yanmin Qian, Xun Gong, and Houjun Huang, · 2022
Cited alongside, same era.
“Decoupling and Interacting Multi-Task Learning Network for Joint Speech and Accent Recognition,”
Qijie Shao, Pengcheng Guo, Jinghao Yan, Pengfei Hu, and Lei Xie, · 2023
Cited alongside, same era.
“Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,”
Yunfei Chu, Jin Xu, Xiaohuan Zhou, Qian Yang, Shiliang Zhang, Zhijie Yan, Chang Zhou, and Jingren Zhou, · 2023
Later among the works it cites.
Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, et al., · 2023
Later among the works it cites.
“Automatic channel selection and spatial feature integration for multi-channel speech recognition across various array topologies,”
Bingshen Mu, Pengcheng Guo, Dake Guo, Pan Zhou, Wei Chen, and Lei Xie, · 2024
Closest in time.
“Hyporadise: An open baseline for generative speech recognition with large language models,”
Chen Chen, Yuchen Hu, Chao-Han Huck Yang, Sabato Marco Siniscalchi, Pin-Yu Chen, and Eng-Siong Chng, · 2024
Closest in time.
“Large language models are efficient learners of noise-robust speech recognition,”
Yuchen Hu, Chen Chen, Chao-Han Huck Yang, Ruizhe Li, Chao Zhang, Pin-Yu Chen, and Eng Siong Chng, · 2024
Closest in time.