Fetching the paper…
Reading the bibliography…
Recent advancements in large language models (LLMs) have revolutionized various domains, bringing significant progress and new opportunities.
“Librispeech: An asr corpus based on public domain audio books,”
Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur, · 2015
Earlier work this paper cites.
“Permutation invariant training of deep models for speaker-independent multi-talker speech separation,”
Dong Yu, Morten Kolbæk, Zheng-Hua Tan, and Jesper Jensen, · 2017
Earlier work this paper cites.
“Parameter-efficient transfer learning for NLP,”
Neil Houlsby, Andrei Giurgiu, et al., · 2019
Earlier work this paper cites.
“Improving end-to-end single-channel multi-talker speech recognition,”
Wangyou Zhang, Xuankai Chang, Yanmin Qian, and Shinji Watanabe, · 2020
Earlier work this paper cites.
“End-to-end multi-speaker speech recognition with transformer,”
Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, and Shinji Watanabe, · 2020
Earlier work this paper cites.
“Serialized output training for end-to-end overlapped speech recognition,”
Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, and Takuya Yoshioka, · 2020
Earlier work this paper cites.
“Unsupervised cross-lingual representation learning for speech recognition,”
Alexis Conneau, Alexei Baevski, Ronan Collobert, Abdelrahman Mohamed, and Michael Auli, · 2020
Earlier work this paper cites.
“Streaming multi-talker speech recognition with joint speaker identification,”
Liang Lu, Naoyuki Kanda, Jinyu Li, and Yifan Gong, · 2021
Earlier work this paper cites.
“End-to-End Speaker-Attributed ASR with Transformer,”
Naoyuki Kanda, Guoli Ye, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, and Takuya Yoshioka, · 2021
Earlier work this paper cites.
“CoVoST 2 and massively multilingual speech translation,”
Changhan Wang, Anne Wu, Jiatao Gu, and Juan Pino, · 2021
Earlier work this paper cites.
“Streaming Multi-Talker ASR with Token-Level Serialized Output Training,”
Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, and Takuya Yoshioka, · 2022
Earlier work this paper cites.
“WavLM: Large-scale self-supervised pre-training for full stack speech processing,”
Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al., · 2022
Earlier work this paper cites.
“LoRA: Low-rank adaptation of large language models,”
Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen, · 2022
Earlier work this paper cites.
OpenAI, · 2023
Earlier work this paper cites.
“LLaMA: Open and efficient foundation language models,”
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, et al., · 2023
Cited alongside, same era.
“Llama 2: Open foundation and fine-tuned chat models,”
Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, et al., · 2023
Cited alongside, same era.
“Language is not all you need: Aligning perception with language models,”
Shaohan Huang, Li Dong, Wenhui Wang, et al., · 2023
Cited alongside, same era.
“A Sidecar separator can convert a single-talker speech recognition system to a multi-talker one,”
Lingwei Meng, Jiawen Kang, Mingyu Cui, Yuejiao Wang, Xixin Wu, and Helen Meng, · 2023
Cited alongside, same era.
“SURT 2.0: Advances in transducer-based multi-talker speech recognition,”
Desh Raj, Daniel Povey, and Sanjeev Khudanpur, · 2023
Cited alongside, same era.
“SALMONN: Towards generic hearing abilities for large language models,”
Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun MA, and Chao Zhang, · 2024
Closest in time.
“Qwen2-audio technical report,”
Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, Chang Zhou, and Jingren Zhou, · 2024
Closest in time.
“Grounding multimodal large language models to the world,”
Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Qixiang Ye, and Furu Wei, · 2024
Closest in time.
“Kosmos-g: Generating images in context with multimodal large language models,”
Xichen Pan, Li Dong, Shaohan Huang, Zhiliang Peng, Wenhu Chen, and Furu Wei, · 2024
Closest in time.
“Video generation models as world simulators,”
Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh, · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
“Adapting self-supervised models to multi-talker speech recognition using speaker embeddings,”
Zili Huang, Desh Raj, Paola García, and Sanjeev Khudanpur, · 2023
Cited alongside, same era.
“End-to-End Joint Target and Non-Target Speakers ASR,”
Ryo Masumura, Naoki Makishima, Taiga Yamane, Yoshihiko Yamazaki, et al., · 2023
Cited alongside, same era.
“Conformer-based target-speaker automatic speech recognition for single-channel audio,”
Yang Zhang, Krishna C. Puvvada, Vitaly Lavrukhin, and Boris Ginsburg, · 2023
Cited alongside, same era.
“Unified modeling of multi-talker overlapped speech recognition and diarization with a Sidecar separator,”
Lingwei Meng, Jiawen Kang, Mingyu Cui, Haibin Wu, Xixin Wu, and Helen Meng, · 2023
Cited alongside, same era.
“Robust speech recognition via large-scale weak supervision,”
Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine Mcleavey, and Ilya Sutskever, · 2023
Cited alongside, same era.
“Whisper-AT: Noise-robust automatic speech recognizers are also strong general audio event taggers,”
Yuan Gong, Sameer Khurana, Leonid Karlinsky, and James Glass, · 2023
Cited alongside, same era.
“Next token prediction towards multimodal intelligence: A comprehensive survey,”
Liang Chen, Zekun Wang, Shuhuai Ren, et al., · 2024
Cited alongside, same era.
“Autoregressive speech synthesis without vector quantization,”
Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, et al., · 2024
Closest in time.
“Serialized output training by learned dominance,”
Ying Shi, Lantian Li, et al., · 2024
Closest in time.
“Disentangling speakers in multi-talker speech recognition with speaker-aware ctc,”
Jiawen Kang, Lingwei Meng, Mingyu Cui, Yuejiao Wang, Xixin Wu, Xunying Liu, and Helen Meng, · 2024
Closest in time.
“Unsupervised domain adaptation on end-to-end multi-talker overlapped speech recognition,”
Lin Zheng, Han Zhu, Sanli Tian, et al., · 2024
Closest in time.
“Unified multi-talker ASR with and without target-speaker enrollment,”
Ryo Masumura, Naoki Makishima, Tomohiro Tanaka, Mana Ihori, et al., · 2024
Closest in time.
“Empowering Whisper as a joint multi-talker and target-talker speech recognition system,”
Lingwei Meng, Jiawen Kang, Yuejiao Wang, Zengrui Jin, Xixin Wu, Xunying Liu, and Helen Meng, · 2024
Closest in time.
“Cross-speaker encoding network for multi-talker speech recognition,”
Jiawen Kang, Lingwei Meng, et al., · 2024
Closest in time.
Samuele Cornell, Taejin Park, Steve Huang, Christoph Boeddeker, Xuankai Chang, Matthew Maciejewski, Matthew Wiesner, Paola Garcia, and Shinji Watanabe, · 2024
Closest in time.