Are sixteen heads really better than one?
P. Michel, O. Levy, and G. Neubig · 2019
Cited alongside, same era.
Pytorch: An imperative style, high-performance deep learning library
A. Paszke, S. Gross, F. Massa, A. Lerer, J. Bradbury, G. Chanan, T. Killeen, Z. Lin, N. Gimelshein, L. Antiga, et al · 2019
Cited alongside, same era.
Language models are unsupervised multitask learners
A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever · 2019
Cited alongside, same era.
Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter
Original
V. Sanh, L. Debut, J. Chaumond, and T. Wolf · 2019
Cited alongside, same era.
Energy and policy considerations for deep learning in nlp
E. Strubell, A. Ganesh, and A. McCallum · 2019
Cited alongside, same era.
Q8bert: Quantized 8bit bert
O. Zafrir, G. Boudoukh, P. Izsak, and M. Wasserblat · 2019
Cited alongside, same era.
Language models are few-shot learners
Original
T. B. Brown, B. Mann, N. Ryder, M. Subbiah, J. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al · 2020
Cited alongside, same era.
The lottery ticket hypothesis for pre-trained bert networks
T. Chen, J. Frankle, S. Chang, S. Liu, Y. Zhang, Z. Wang, and M. Carbin · 2020
Cited alongside, same era.
Compressing bert: Studying the effects of weight pruning on transfer learning
M. Gordon, K. Duh, and N. Andrews · 2020
Cited alongside, same era.
Tinybert: Distilling bert for natural language understanding
X. Jiao, Y. Yin, L. Shang, X. Jiang, X. Chen, L. Li, F. Wang, and Q. Liu · 2020
Cited alongside, same era.
Fastformers: Highly efficient transformer models for natural language understanding
Y. J. Kim and H. Hassan · 2020
Cited alongside, same era.
Comparing rewinding and fine-tuning in neural network pruning
A. Renda, J. Frankle, and M. Carbin · 2020
Cited alongside, same era.