wav2vec 2.0: A framework for self-supervised learning of speech representations
Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, and Michael Auli · 2020
Cited alongside, same era.
Gunshots recorded in an open field using ipod touch devices, 2020
Seth Cooper and Steven Shaw · 2020
Cited alongside, same era.
Fsd50k: an open dataset of human-labeled sound events
Original
Eduardo Fonseca, Xavier Favory, Jordi Pons, Frederic Font, and Xavier Serra · 2020
Cited alongside, same era.
Panns: Large-scale pretrained audio neural networks for audio pattern recognition
Qiuqiang Kong, Yin Cao, Turab Iqbal, Yuxuan Wang, Wenwu Wang, and Mark D. Plumbley · 2020
Cited alongside, same era.
Mockingjay: Unsupervised speech representation learning with deep bidirectional transformer encoders
Andy T. Liu, Shu-wen Yang, Po-Han Chi, Po-chun Hsu, and Hung-yi Lee · 2020
Cited alongside, same era.
Towards learning a universal non-semantic representation of speech
Joel Shor, Aren Jansen, Ronnie Maor, Oran Lang, Omry Tuval, Félix de Chaumont Quitry, Marco Tagliasacchi, Ira Shavitt, Dotan Emanuel, and Yinnon Haviv · 2020
Cited alongside, same era.
Beit: Bert pre-training of image transformers
Original
Hangbo Bao, Li Dong, and Furu Wei · 2021
Cited alongside, same era.
Audio albert: A lite bert for self-supervised learning of audio representation
Po-Han Chi, Pei-Hung Chung, Tsung-Han Wu, Chun-Cheng Hsieh, Yen-Hao Chen, Shang-Wen Li, and Hung-yi Lee · 2021
Cited alongside, same era.
An image is worth 16x16 words: Transformers for image recognition at scale
Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby · 2021
Cited alongside, same era.
Unsupervised contrastive learning of sound event representations
Eduardo Fonseca, Diego Ortego, Kevin McGuinness, Noel E. O’Connor, and Xavier Serra · 2021
Cited alongside, same era.
Ssast: Self-supervised audio spectrogram transformer
Original
Yuan Gong, Cheng-I Jeff Lai, Yu-An Chung, and James Glass · 2021
Cited alongside, same era.
Masked autoencoders are scalable vision learners
Original
Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, and Ross Girshick · 2021
Cited alongside, same era.