Fetching the paper…
Reading the bibliography…
Recent advancements in speech generation models have been significantly driven by the use of large-scale training data.
“The LJ Speech Dataset,” https://keithito.com/LJ-Speech-Dataset/ , 2017
Keith Ito and Linda Johnson, · 2017
Earlier work this paper cites.
“CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR Voice Cloning Toolkit (version 0.92),” 2019
Junichi Yamagishi and Christophe Veaux and Kirsten MacDonald, · 2019
Earlier work this paper cites.
“LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech,”
Zen, Heiga and Dang, Viet and Clark, Rob and Zhang, Yu and Weiss, Ron J and Jia, Ye and Chen, Zhifeng and Wu, Yonghui, · 2019
Earlier work this paper cites.
“Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,”
Reimers, Nils and Gurevych, Iryna, · 2019
Earlier work this paper cites.
“Libri-Light: A Benchmark for ASR with Limited or No Supervision,”
Kahn, Jack and Rivière, Morgane and Zheng, Wei and Kharitonov, Eugene and Xu, Qiantong and Mazaré, Pierre-Emmanuel and Karadayi, Jim and Liptchinsky, Vitaliy and Collobert, Ronan and Fuegen, Christian and Likhomanenko, Tatiana and Synnaeve, Gabriel and Joulin, Armand and Mohamed, Abdelrahman and Dupoux, Emmanuel, · 2020
Earlier work this paper cites.
“MLS: A Large-Scale Multilingual Dataset for Speech Research,”
Pratap, Vineel and Xu, Qiantong and Sriram, Anuroop and Synnaeve, Gabriel and Collobert, Ronan, · 2020
Earlier work this paper cites.
“A Survey on Neural Speech Synthesis,”
Tan, Xu and Qin, Tao and Soong, Frank and Liu, Tie-Yan, · 2021
Earlier work this paper cites.
“AISHELL-3: A Multi-Speaker Mandarin TTS Corpus,”
Yao, Shi and Bu, Hui and Xu, Xin and Zhang, Shaoji and Li, Ming, · 2021
Earlier work this paper cites.
“GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio,”
Chen, Guoguo and Chai, Shuzhou and Wang, Guanbo and Du, Jiayu and Zhang, Wei-Qiang and Weng, Chao and Su, Dan and Povey, Daniel and Trmal, Jan and Zhang, Junbo and Jin, Mingjie and Khudanpur, Sanjeev and Watanabe, Shinji and Zhao, Shuaijiang and Zou, Wei and Li, Xiangang and Yao, Xuchen and Wang, Yongqing and Wang, Yujun and You, Zhao and Yan, Zhiyong, · 2021
Cited alongside, same era.
“How Far Are We from Robust Voice Conversion: A Survey,”
Huang, Tzu-hsien and Lin, Jheng-hao and Lee, Hung-yi, · 2021
Cited alongside, same era.
“DNSMOS P.835: A Non-intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors,”
Reddy, Chandan KA and Gopal, Vishak and Cutler, Ross, · 2022
Cited alongside, same era.
“WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,”
Chen, Sanyuan and Wang, Chengyi and Chen, Zhengyang and Wu, Yu and Liu, Shujie and Chen, Zhuo and Li, Jinyu and Kanda, Naoyuki and Yoshioka, Takuya and Xiao, Xiong and others, · 2022
Cited alongside, same era.
“VoiceBox: Text-guided Multilingual Universal Speech Generation at Scale,”
Le, Matthew and Vyas, Apoorv and Shi, Bowen and Karrer, Brian and Sari, Leda and Moritz, Rashel and Williamson, Mary and Manohar, Vimal and Adi, Yossi and Mahadeokar, Jay and others, · 2024
Closest in time.
“NaturalSpeech 3: Zero-shot Speech Synthesis with Factorized Codec and Diffusion Models,”
Ju, Zeqian and Wang, Yuancheng and Shen, Kai and Tan, Xu and Xin, Detai and Yang, Dongchao and Liu, Yanqing and Leng, Yichong and Song, Kaitao and Tang, Siliang and others, · 2024
Closest in time.
“Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity Vocoder,”
Gu, Yicheng and Zhang, Xueyao and Xue, Liumeng and Wu, Zhizheng, · 2024
Closest in time.
“Voicebox: Text-guided Multilingual Universal Speech Generation at Scale,”
Le, Matthew and Vyas, Apoorv and Shi, Bowen and Karrer, Brian and Sari, Leda and Moritz, Rashel and Williamson, Mary and Manohar, Vimal and Adi, Yossi and Mahadeokar, Jay and others, · 2024
Closest in time.
“Amphion: An Open-Source Audio, Music and Speech Generation Toolkit,”
Zhang, Xueyao and Xue, Liumeng and Gu, Yicheng and Wang, Yuancheng and Li, Jiaqi and He, Haorui and Wang, Chaoren and Song, Ting and Chen, Xi and Fang, Zihao and Chen, Haopeng and Zhang, Junan and Tang, Tze Ying and Zou, Lexiao and Wang, Mingxuan and Han, Jun and Chen, Kai and Li, Haizhou and Wu, Zhizheng, · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Borsos, Zalán and Sharifi, Matt and Vincent, Damien and Kharitonov, Eugene and Zeghidour, Neil and Tagliasacchi, Marco, · 2023
Cited alongside, same era.
“Powerset Multi-class Cross Entropy Loss for Neural Speaker Diarization,”
Alexis Plaquet and Hervé Bredin, · 2023
Cited alongside, same era.
“WhisperX: Time-Accurate Speech Transcription of Long-Form Audio,”
Bain, Max and Huh, Jaesung and Han, Tengda and Zisserman, Andrew, · 2023
Cited alongside, same era.
“AudioLM: A Language Modeling Approach to Audio Generation,”
Borsos, Zalán and Marinier, Raphaël and Vincent, Damien and Kharitonov, Eugene and Pietquin, Olivier and Sharifi, Matt and Roblek, Dominik and Teboul, Olivier and Grangier, David and Tagliasacchi, Marco and Zeghidour, Neil, · 2023
Cited alongside, same era.
Closest in time.
“AutoPrep: An Automatic Preprocessing Framework for In-The-Wild Speech Data,”
Yu, Jianwei and Chen, Hangting and Bian, Yanyao and Li, Xiang and Luo, Yi and Tian, Jinchuan and Liu, Mengyang and Jiang, Jiayi and Wang, Shuai, · 2024
Closest in time.
“WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark,”
Ma, Linhan and Guo, Dake and Song, Kun and Jiang, Yuepeng and Wang, Shuai and Xue, Liumeng and Xu, Weiming and Zhao, Huan and Zhang, Binbin and Xie, Lei, · 2024
Closest in time.