Optuna: A next-generation hyperparameter optimization framework, 2019
Takuya Akiba, Shotaro Sano, Toshihiko Yanase, Takeru Ohta, and Masanori Koyama · 2019
Later among the works it cites.
Layer rotation: a surprisingly powerful indicator of generalization in deep networks?
Original
Simon Carbonnelle and Christophe De Vleeschouwer · 2019
Later among the works it cites.
Transformer-xl: Attentive language models beyond a fixed-length context, 2019
Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V. Le, and Ruslan Salakhutdinov · 2019
Later among the works it cites.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Original
Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova · 2019
Later among the works it cites.
Multi-task deep neural networks for natural language understanding
Xiaodong Liu, Pengcheng He, Weizhu Chen, and Jianfeng Gao · 2019
Later among the works it cites.
fairseq: A fast, extensible toolkit for sequence modeling, mit license
Myle Ott, Sergey Edunov, Alexei Baevski, Angela Fan, Sam Gross, Nathan Ng, David Grangier, and Michael Auli · 2019
Later among the works it cites.
Pytorch: An imperative style, high-performance deep learning library, bsd-style license
Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, Alban Desmaison, Andreas Kopf, Edward Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala · 2019
Later among the works it cites.
Residual Learning Without Normalization via Better Initialization
Hongyi Zhang, Yann N. Dauphin, and Tengyu Ma · 2019
Later among the works it cites.
Language models are few-shot learners, 2020
Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, and Dario Amodei · 2020
Later among the works it cites.
A system for massively parallel hyperparameter tuning, 2020
Liam Li, Kevin Jamieson, Afshin Rostamizadeh, Ekaterina Gonina, Moritz Hardt, Benjamin Recht, and Ameet Talwalkar · 2020
Later among the works it cites.
Understanding the difficulty of training transformers
Liyuan Liu, Xiaodong Liu, Jianfeng Gao, Weizhu Chen, and Jiawei Han · 2020
Later among the works it cites.
Feature learning in infinite-width neural networks
Greg Yang and Edward J. Hu · 2020
Later among the works it cites.
RepMLP: Re-parameterizing Convolutions into Fully-connected Layers for Image Recognition
Original
Xiaohan Ding, Chunlong Xia, Xiangyu Zhang, Xiaojie Chu, Jungong Han, and Guiguang Ding · 2021
Later among the works it cites.
Hyperparameter transfer learning with adaptive complexity
Original
Samuel Horváth, Aaron Klein, Peter Richtárik, and Cédric Archambeau · 2021
Later among the works it cites.
Do You Even Need Attention? A Stack of Feed-Forward Layers Does Surprisingly Well on ImageNet
Original
Luke Melas-Kyriazi · 2021
Later among the works it cites.
Hyperparameter transfer across developer adjustments, 2021
Danny Stoll, Jörg K.H. Franke, Diane Wagner, Simon Selg, and Frank Hutter · 2021
Later among the works it cites.
MLP-Mixer: An all-MLP Architecture for Vision
Original
Ilya Tolstikhin, Neil Houlsby, Alexander Kolesnikov, Lucas Beyer, Xiaohua Zhai, Thomas Unterthiner, Jessica Yung, Andreas Steiner, Daniel Keysers, Jakob Uszkoreit, Mario Lucic, and Alexey Dosovitskiy · 2021
Later among the works it cites.
ResMLP: Feedforward networks for image classification with data-efficient training
Original
Hugo Touvron, Piotr Bojanowski, Mathilde Caron, Matthieu Cord, Alaaeldin El-Nouby, Edouard Grave, Gautier Izacard, Armand Joulin, Gabriel Synnaeve, Jakob Verbeek, and Hervé Jégou · 2021
Later among the works it cites.
Tensor Programs IIb: Architectural Universality of Neural Tangent Kernel Training Dynamics
Original
Greg Yang and Etai Littwin · 2021
Later among the works it cites.
Efficient computation of deep nonlinear infinite-width neural networks that learn features
Greg Yang, Michael Santacroce, and Edward J Hu · 2022
Closest in time.