“wav2vec 2.0: A framework for self-supervised learning of speech representations,”
A. Baevski, Y. Zhou, et al., · 2020
Cited alongside, same era.
“Exploring wav2vec 2.0 on speaker verification and language identification,”
Original
Z. Fan, M. Li, et al., · 2020
Cited alongside, same era.
“Conformer: Convolution-augmented transformer for speech recognition,”
A. Gulati, J. Qin, et al., · 2020
Cited alongside, same era.
“Pushing the limits of semi-supervised learning for automatic speech recognition,”
Original
Y. Zhang, J. Qin, et al., · 2020
Cited alongside, same era.
“Convolution-augmented transformer for semisupervised sound event detection,”
K. Miyazaki, T. Komatsu, et al., · 2020
Cited alongside, same era.
“Coincidence, categorization, and consolidation: Learning to recognize sounds with minimal supervision,”
A. Jansen, D. P. W. Ellis, et al., · 2020
Cited alongside, same era.
“Contrastive predictive coding of audio with an adversary,”
L. Wang, K. Kawakami, and A. van den Oord, · 2020
Cited alongside, same era.
“Self-supervised multimodal versatile networks,”
J.-B. Alayrac, A. Recasens, et al., · 2020
Cited alongside, same era.
“A sequential self teaching approach for improving generalization in sound event recognition,”
A. Kumar and V. Ithapu, · 2020
Cited alongside, same era.
“PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,”
Q. Kong, Y. Cao, et al., · 2020
Cited alongside, same era.
“VATT: Transformers for multimodal self-supervised learning from raw video, audio and text,”
Original
H. Akbari, L. Yuan, et al., · 2021
Cited alongside, same era.
“CL4AC: A contrastive loss for audio captioning,”
Original
X. Liu, Q. Huang, X. Mei, T. Ko, H. L. Tang, M. D. Plumbley, and W. Wang, · 2021
Cited alongside, same era.