Fetching the paper…
Reading the bibliography…
Speech recognition models often obtain degraded performance when tested on speech with unseen accents.
“Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,”
Alex Graves, Santiago Fernández, Faustino Gomez, and Jürgen Schmidhuber, · 2006
Earlier work this paper cites.
“Visualizing data using t-sne.,”
Laurens Van der Maaten and Geoffrey Hinton, · 2008
Earlier work this paper cites.
“Front-end factor analysis for speaker verification,”
Najim Dehak, Patrick J Kenny, Réda Dehak, Pierre Dumouchel, and Pierre Ouellet, · 2010
Earlier work this paper cites.
“Scikit-learn: Machine learning in python,”
Fabian Pedregosa, Gaël Varoquaux, Alexandre Gramfort, Vincent Michel, Bertrand Thirion, Olivier Grisel, Mathieu Blondel, Peter Prettenhofer, Ron Weiss, Vincent Dubourg, et al., · 2011
Earlier work this paper cites.
“Very deep convolutional networks for large-scale image recognition,”
Karen Simonyan and Andrew Zisserman, · 2014
Earlier work this paper cites.
“Improving deep neural networks based multi-accent mandarin speech recognition using i-vectors and accent-specific top layer,”
Mingming Chen, Zhanlei Yang, Jizhong Liang, Yanpeng Li, and Wenju Liu, · 2015
Earlier work this paper cites.
“Audio augmentation for speech recognition,”
Tom Ko, Vijayaditya Peddinti, Daniel Povey, and Sanjeev Khudanpur, · 2015
Earlier work this paper cites.
“Domain-adversarial training of neural networks,”
Yaroslav Ganin, Evgeniya Ustinova, Hana Ajakan, Pascal Germain, Hugo Larochelle, François Laviolette, Mario Marchand, and Victor Lempitsky, · 2016
Earlier work this paper cites.
“Transfer learning for speech recognition on a budget,”
Julius Kunze, Louis Kirsch, Ilia Kurenkov, Andreas Krug, Jens Johannsmeier, and Sebastian Stober, · 2017
Earlier work this paper cites.
“The adaptation of french consonant clusters in vietnamese phonology: An ot account,”
Huynh Trang Nguyen, Hemanga Dutta, et al., · 2017
Earlier work this paper cites.
“Improved accented speech recognition using accent embeddings and multi-task learning.,”
Abhinav Jain, Minali Upreti, and Preethi Jyothi, · 2018
Cited alongside, same era.
“Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling,”
Jaejin Cho, Murali Karthick Baskar, et al., · 2018
Cited alongside, same era.
“Noise adaptive speech enhancement using domain adversarial training,”
Chien-Feng Liao, Yu Tsao, Hung-Yi Lee, and Hsin-Min Wang, · 2018
Cited alongside, same era.
“Unsupervised domain adaptation via domain adversarial training for speaker recognition,”
Qing Wang, Wei Rao, Sining Sun, Leib Xie, Eng Siong Chng, and Haizhou Li, · 2018
Cited alongside, same era.
“Domain adversarial training for accented speech recognition,”
Sining Sun, Ching-Feng Yeh, Mei-Yuh Hwang, Mari Ostendorf, and Lei Xie, · 2018
Cited alongside, same era.
“Aipnet: Generative adversarial pre-training of accent-invariant networks for end-to-end speech recognition,”
Yi-Chen Chen, Zhaojun Yang, Ching-Feng Yeh, Mahaveer Jain, and Michael L Seltzer, · 2020
Later among the works it cites.
“Improved blstm rnn based accent speech recognition using multi-task learning and accent embeddings,”
Wenbi Rao, Ji Zhang, and Jianwei Wu, · 2020
Later among the works it cites.
“wav2vec 2.0: A framework for self-supervised learning of speech representations,”
Alexei Baevski, Henry Zhou, Abdelrahman Mohamed, and Michael Auli, · 2020
Later among the works it cites.
“Deja-vu: Double feature presentation and iterated loss in deep transformer networks,”
Andros Tjandra, Chunxi Liu, et al., · 2020
Later among the works it cites.
“Faster, Simpler and More Accurate Hybrid ASR Systems Using Wordpieces,”
Frank Zhang, Yongqiang Wang, Xiaohui Zhang, Chunxi Liu, Yatharth Saraf, and Geoffrey Zweig, · 2020
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“X-vectors: Robust dnn embeddings for speaker recognition,”
David Snyder, Daniel Garcia-Romero, et al., · 2018
Cited alongside, same era.
Taku Kudo and John Richardson, · 2018
Cited alongside, same era.
“End-to-end accented speech recognition.,”
Thibault Viglino, Petr Motlicek, and Milos Cernak, · 2019
Cited alongside, same era.
“wav2vec: Unsupervised pre-training for speech recognition,”
Steffen Schneider, Alexei Baevski, Ronan Collobert, and Michael Auli, · 2019
Cited alongside, same era.
“Achieving multi-accent asr via unsupervised acoustic model adaptation,”
Mehmet Ali Tuğtekin Turan, Emmanuel Vincent, and Denis Jouvet, · 2020
Cited alongside, same era.
“Redat: Accent-invariant representation for end-to-end ASR by domain adversarial training with relabeling,”
Hu Hu, Xuesong Yang, Zeynab Raeesy, Jinxi Guo, Gokce Keskin, Harish Arsikere, Ariya Rastrow, Andreas Stolcke, and Roland Maas, · 2021
Closest in time.
“End-to-end multi-accent speech recognition with unsupervised accent modelling,”
Song Li, Beibei Ouyang, Dexin Liao, Shipeng Xia, Lin Li, and Qingyang Hong, · 2021
Closest in time.
“Emotion recognition from speech using wav2vec 2.0 embeddings,”
Leonardo Pepino, Pablo Riera, and Luciana Ferrer, · 2021
Closest in time.
“Improved language identification through cross-lingual self-supervised learning,”
Andros Tjandra, Diptanu Gon Choudhury, Frank Zhang, Kritika Singh, Alexei Baevski, Assaf Sela, Yatharth Saraf, and Michael Auli, · 2021
Closest in time.
“Unsupervised speech recognition,”
Alexei Baevski, Wei-Ning Hsu, Alexis Conneau, and Michael Auli, · 2021
Closest in time.