“A survey of speaker recognition: Fundamental theories, recognition methods and opportunities,”
Muhammad Mohsin Kabir, M. F. Mridha, Jungpil Shin, Israt Jahan, and Abu Quwsar Ohi, · 2021
Cited alongside, same era.
“Emerging properties in self-supervised vision transformers,”
Mathilde Caron, Hugo Touvron, Ishan Misra, Hervé Jégou, Julien Mairal, Piotr Bojanowski, and Armand Joulin, · 2021
Cited alongside, same era.
“Hubert: Self-supervised speech representation learning by masked prediction of hidden units,”
Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, and Abdelrahman Mohamed, · 2021
Cited alongside, same era.
“A literature survey on speech enhancement based on deep neural network technique,”
Ramesh Nuthakki, Payel Masanta, and T. N. Yukta, · 2022
Cited alongside, same era.
“Wavlm: Large-scale self-supervised pre-training for full stack speech processing,”
Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al., · 2022
Cited alongside, same era.
“High fidelity speech enhancement with band-split rnn,”
Original
Jianwei Yu, Yi Luo, Hangting Chen, Rongzhi Gu, and Chao Weng, · 2022
Cited alongside, same era.
“Dnsmos p. 835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,”
Chandan KA Reddy, Vishak Gopal, and Ross Cutler, · 2022
Cited alongside, same era.
“Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition,”
Binbin Zhang, Hang Lv, Pengcheng Guo, Qijie Shao, Chao Yang, Lei Xie, Xin Xu, Hui Bu, Xiaoyu Chen, Chenchen Zeng, et al., · 2022
Cited alongside, same era.
“Cn-celeb: multi-genre speaker recognition,”
Lantian Li, Ruiqi Liu, Jiawen Kang, Yue Fan, Hao Cui, Yunqi Cai, Ravichander Vipperla, Thomas Fang Zheng, and Dong Wang, · 2022
Cited alongside, same era.
“End-to-end speech recognition: A survey,”
Original
Rohit Prabhavalkar, Takaaki Hori, Tara N Sainath, Ralf Schlüter, and Shinji Watanabe, · 2023
Cited alongside, same era.
“Robust speech recognition via large-scale weak supervision,”
Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever, · 2023
Cited alongside, same era.
“Investigating rnn-based speech enhancement methods for noise-robust text-to-speech,”
Cassia Valentini-Botinhao, Xin Wang, Shinji Takaki, and Junichi Yamagishi,
Cited in the paper.