Transformer feed-forward layers are key-value memories
Original
M. Geva, R. Schuster, J. Berant, and O. Levy · 2020
Cited alongside, same era.
Scaling laws for neural language models
Original
J. Kaplan, S. McCandlish, T. Henighan, T. B. Brown, B. Chess, R. Child, S. Gray, A. Radford, J. Wu, and D. Amodei · 2020
Cited alongside, same era.
Zoom in: An introduction to circuits
C. Olah, N. Cammarata, L. Schubert, G. Goh, M. Petrov, and S. Carter · 2020
Cited alongside, same era.
A mathematical framework for Transformer circuits
N. Elhage, N. Nanda, C. Olsson, T. Henighan, N. Joseph, B. Mann, A. Askell, Y. Bai, A. Chen, T. Conerly, N. DasSarma, D. Drain, D. Ganguli, Z. Hatfield-Dodds, D. Hernandez, A. Jones, J. Kernion, L. Lovitt, K. Ndousse, D. Amodei, T. Brown, J. Clark, J. Kaplan, S. McCandlish, and C. Olah · 2021
Cited alongside, same era.
Grokking: Generalization beyond overfitting on small algorithmic datasets
A. Power, Y. Burda, H. Edwards, I. Babuschkin, and V. Misra · 2021
Cited alongside, same era.
The implicit bias for adaptive optimization algorithms on homogeneous neural networks
B. Wang, Q. Meng, W. Chen, and T.-Y. Liu · 2021
Cited alongside, same era.
Understanding deep learning (still) requires rethinking generalization
C. Zhang, S. Bengio, M. Hardt, B. Recht, and O. Vinyals · 2021
Cited alongside, same era.
Hidden progress in deep learning: SGD learns parities near the computational limit
B. Barak, B. Edelman, S. Goel, S. Kakade, E. Malach, and C. Zhang · 2022
Cited alongside, same era.
Toy models of superposition
N. Elhage, T. Hume, C. Olsson, N. Schiefer, T. Henighan, S. Kravec, Z. Hatfield-Dodds, R. Lasenby, D. Drain, C. Chen, R. Grosse, S. McCandlish, J. Kaplan, D. Amodei, M. Wattenberg, and C. Olah · 2022
Cited alongside, same era.
Multi-component learning and s-curves, 2022
A. Jermyn and B. Shlegeris · 2022
Cited alongside, same era.
Emergent world representations: Exploring a sequence model trained on a synthetic task
Original
K. Li, A. K. Hopkins, D. Bau, F. Viégas, H. Pfister, and M. Wattenberg · 2022
Cited alongside, same era.
Towards understanding grokking: An effective theory of representation learning
Original
Z. Liu, O. Kitouni, N. Nolte, E. J. Michaud, M. Tegmark, and M. Williams · 2022
Cited alongside, same era.