“NLP’s ImageNet moment has arrived” Accessed: 2020-04-12, https://thegradient.pub/nlp-imagenet/ , 2018
Sebastian Ruder · 2018
Cited alongside, same era.
“DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter”
Victor Sanh, Lysandre Debut, Julien Chaumond and Thomas Wolf · 2019
Cited alongside, same era.
“BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding”
Jacob Devlin, Ming-Wei Chang, Kenton Lee and Kristina Toutanova · 2019
Cited alongside, same era.
“Show Your Work: Improved Reporting of Experimental Results”
Jesse Dodge et al · 2019
Cited alongside, same era.
“Language Models are Unsupervised Multitask Learners”, OpenAI’s Blog: https://d4mucfpksywv.cloudfront.net/better-language-models/language_models_are_unsupervised_multitask_learners.pdf , 2019
Alec Radford et al · 2019
Cited alongside, same era.
“Fixing the train-test resolution discrepancy”
Hugo Touvron, Andrea Vedaldi, Matthijs Douze and Herve Jegou · 2019
Cited alongside, same era.
“ResNet-50 Training Cost Comparison” Accessed: 2020-04-12, https://cloud.google.com/images/products/tpu/machine-learning-performance_2x.png , 2020
Google · 2020
Cited alongside, same era.