Fetching the paper…
Reading the bibliography…
The growing popularity of multi-channel wearable devices, such as smart glasses, has led to a surge of applications such as targeted speech recognition and enhanced hearing.
“Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,”
Alex Graves, Santiago Fernández, Faustino Gomez, and Jürgen Schmidhuber, · 2006
Earlier work this paper cites.
“LibriSpeech: an ASR corpus based on public domain audio books,”
Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur, · 2015
Earlier work this paper cites.
“Very deep convolutional networks for large-scale image recognition,”
Karen Simonyan and Andrew Zisserman, · 2015
Earlier work this paper cites.
“TED-LIUM 3: Twice as much data and corpus repartition for experiments on speaker adaptation,”
François Hernandez, Vincent Nguyen, Sahar Ghannay, Natalia Tomashenko, and Yannick Esteve, · 2018
Earlier work this paper cites.
“wav2vec: Unsupervised pre-training for speech recognition,”
Steffen Schneider, Alexei Baevski, Ronan Collobert, and Michael Auli, · 2019
Earlier work this paper cites.
“SpecAugment: A simple data augmentation method for automatic speech recognition,”
Daniel S Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D Cubuk, and Quoc V Le, · 2019
Earlier work this paper cites.
“wav2vec 2.0: A framework for self-supervised learning of speech representations,”
Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, and Michael Auli, · 2020
Earlier work this paper cites.
“Libri-Light: A benchmark for ASR with limited or no supervision,”
Jacob Kahn, Morgane Riviere, Weiyi Zheng, Evgeny Kharitonov, Qiantong Xu, Pierre-Emmanuel Mazaré, Julien Karadayi, Vitaliy Liptchinsky, Ronan Collobert, Christian Fuegen, et al., · 2020
Earlier work this paper cites.
“Conformer: Convolution-augmented transformer for speech recognition,”
Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, et al., · 2020
Earlier work this paper cites.
“Serialized output training for end-to-end overlapped speech recognition,”
Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, and Takuya Yoshioka, · 2020
Earlier work this paper cites.
“HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,”
Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, and Abdelrahman Mohamed, · 2021
Cited alongside, same era.
“SUPERB: Speech processing universal performance benchmark,”
Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu hsien Huang, Wei-Cheng Tseng, Ko tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdel-rahman Mohamed, and Hung-yi Lee, · 2021
Cited alongside, same era.
“On the opportunities and risks of foundation models,”
Rishi Bommasani, Drew A Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S Bernstein, Jeannette Bohg, Antoine Bosselut, Emma Brunskill, et al., · 2021
Cited alongside, same era.
Jacob Donley, Vladimir Tourbabin, Jung-Suk Lee, Mark Broyles, Hao Jiang, Jie Shen, Maja Pantic, Vamsi Krishna Ithapu, and Ravish Mehra, · 2021
Cited alongside, same era.
Antoni Dimitriadis, Siqi Pan, Vidhyasaharan Sethu, and Beena Ahmed, · 2023
Later among the works it cites.
“Directional speech recognition for speaker disambiguation and cross-talk suppression,”
Ju Lin, Niko Moritz, Ruiming Xie, Kaustubh Kalgaonkar, Christian Fuegen, and Frank Seide, · 2023
Later among the works it cites.
“Audio visual speaker localization from egocentric views,”
Jinzheng Zhao, Yong Xu, Xinyuan Qian, and Wenwu Wang, · 2023
Later among the works it cites.
“Multichannel AV-wav2vec2: A framework for learning multichannel multi-modal speech representation,”
Qiushi Zhu, Jie Zhang, Yu Gu, Yuchen Hu, and Lirong Dai, · 2024
Closest in time.
“UniX-Encoder: A universal x-channel speech encoder for ad-hoc microphone array speech processing,”
Zili Huang, Yiwen Shao, Shi-Xiong Zhang, and Dong Yu, · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“End-to-end multi-channel transformer for speech recognition,”
Feng-Ju Chang, Martin H. Radfar, Athanasios Mouchtaris, Brian King, and Siegfried Kunzmann, · 2021
Cited alongside, same era.
“Self-supervised speech representation learning: A review,”
Abdelrahman Mohamed, Hung-yi Lee, Lasse Borgholt, Jakob D Havtorn, Joakim Edin, Christian Igel, Katrin Kirchhoff, Shang-Wen Li, Karen Livescu, Lars Maaløe, et al., · 2022
Cited alongside, same era.
“WavLM: Large-scale self-supervised pre-training for full stack speech processing,”
Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al., · 2022
Cited alongside, same era.
“Self-supervised learning with random-projection quantizer for speech recognition,”
Chung-Cheng Chiu, James Qin, Yu Zhang, Jiahui Yu, and Yonghui Wu, · 2022
Cited alongside, same era.
“Egocentric deep multi-channel audio-visual active speaker localization,”
Hao Jiang, Calvin Murdock, and Vamsi Krishna Ithapu, · 2022
Cited alongside, same era.
“Project Aria: A new tool for egocentric multi-modal AI research,”
Jakob Engel, Kiran Somasundaram, Michael Goesele, Albert Sun, Alexander Gamino, Andrew Turner, Arjang Talattof, Arnie Yuan, Bilal Souti, Brighid Meredith, et al., · 2023
Cited alongside, same era.
Closest in time.
“Open implementation and study of BEST-RQ for speech processing,”
Ryan Whetten, Titouan Parcollet, Marco Dinarelli, and Yannick Estève, · 2024
Closest in time.
“The CHiME-8 MMCSG challenge: Multi-modal conversations in smart glasses,”
Kateřina Žmolíková, Simone Merello, Kaustubh Kalgaonkar, Ju Lin, Niko Moritz, Pingchuan Ma, Ming Sun, Honglie Chen, Antoine Saliou, Stavros Petridis, Christian Fuegen, and Michael Mandel, · 2024
Closest in time.
“AGADIR: Towards array-geometry agnostic directional speech recognition,”
Ju Lin, Niko Moritz, Yiteng Huang, Ruiming Xie, Ming Sun, Christian Fuegen, and Frank Seide, · 2024
Closest in time.
“Stateful Conformer with cache-based inference for streaming automatic speech recognition,”
Vahid Noroozi, Somshubra Majumdar, Ankur Kumar, Jagadeesh Balam, and Boris Ginsburg, · 2024
Closest in time.
“Spherical world-locking for audio-visual localization in egocentric videos,”
Heeseung Yun, Ruohan Gao, Ishwarya Ananthabhotla, Anurag Kumar, Jacob Donley, Chao Li, Gunhee Kim, Vamsi Krishna Ithapu, and Calvin Murdock, · 2024
Closest in time.