Fetching the paper…
Reading the bibliography…
Recent advancements in audio generation have enabled the creation of high-fidelity audio clips from free-form textual descriptions.
“Metrics for polyphonic sound event detection,”
Annamaria Mesaros, Toni Heittola, and Tuomas Virtanen, · 2016
Earlier work this paper cites.
“Audio set: An ontology and human-labeled dataset for audio events,”
Jort F Gemmeke, Daniel PW Ellis, Dylan Freedman, Aren Jansen, Wade Lawrence, R Channing Moore, Manoj Plakal, and Marvin Ritter, · 2017
Earlier work this paper cites.
“Scaper: A library for soundscape synthesis and augmentation,”
Justin Salamon, Duncan MacConnell, Mark Cartwright, Peter Li, and Juan Pablo Bello, · 2017
Earlier work this paper cites.
“Audiocaps: Generating captions for audios in the wild,”
Chris Dongjoo Kim, Byeongchang Kim, Hyunmin Lee, and Gunhee Kim, · 2019
Earlier work this paper cites.
“Audiogen: Textually guided audio generation,”
Felix Kreuk, Gabriel Synnaeve, Adam Polyak, Uriel Singer, Alexandre Défossez, Jade Copet, Devi Parikh, Yaniv Taigman, and Yossi Adi, · 2022
Earlier work this paper cites.
“Diffsound: Discrete diffusion model for text-to-sound generation,”
Dongchao Yang, Jianwei Yu, Helin Wang, Wen Wang, Chao Weng, Yuexian Zou, and Dong Yu, · 2023
Earlier work this paper cites.
“Audioldm: Text-to-audio generation with latent diffusion models,”
Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, and Mark D Plumbley, · 2023
Earlier work this paper cites.
“Audioldm 2: Learning holistic audio generation with self-supervised pretraining,”
Haohe Liu, Qiao Tian, Yi Yuan, Xubo Liu, Xinhao Mei, Qiuqiang Kong, Yuping Wang, Wenwu Wang, Yuxuan Wang, and Mark D Plumbley, · 2023
Cited alongside, same era.
“Text-to-audio generation using instruction-tuned llm and latent diffusion model,”
Deepanway Ghosal, Navonil Majumder, Ambuj Mehrish, and Soujanya Poria, · 2023
Cited alongside, same era.
“Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,”
Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, and Zhou Zhao, · 2023
Cited alongside, same era.
“Make-an-audio 2: Temporal-enhanced text-to-audio generation,”
Jiawei Huang, Yi Ren, Rongjie Huang, Dongchao Yang, Zhenhui Ye, Chen Zhang, Jinglin Liu, Xiang Yin, Zejun Ma, and Zhou Zhao, · 2023
Cited alongside, same era.
Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, et al., · 2023
Later among the works it cites.
“Enhance temporal relations in audio captioning with sound event detection,”
Zeyu Xie, Xuenan Xu, Mengyue Wu, and Kai Yu, · 2023
Later among the works it cites.
Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, and Soujanya Poria, · 2024
Closest in time.
“Syncfusion: Multimodal onset-synchronized video-to-audio foley synthesis,”
Marco Comunità, Riccardo F Gramaccioni, Emilian Postolache, Emanuele Rodolà, Danilo Comminiello, and Joshua D Reiss, · 2024
Closest in time.
“A detailed audio-text data simulation pipeline using single-event sounds,”
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Zhifang Guo, Jianguo Mao, Rui Tao, Long Yan, Kazushige Ouchi, Hong Liu, and Xiangdong Wang, · 2023
Cited alongside, same era.
“Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,”
Yusong Wu*, Ke Chen*, Tianyu Zhang*, Yuchen Hui*, Taylor Berg-Kirkpatrick, and Shlomo Dubnov, · 2023
Cited alongside, same era.
Xuenan Xu, Xiaohang Xu, Zeyu Xie, Pingyue Zhang, Mengyue Wu, and Kai Yu, · 2024
Closest in time.
“Towards weakly supervised text-to-audio grounding,”
Xuenan Xu, Ziyang Ma, Mengyue Wu, and Kai Yu, · 2024
Closest in time.