Language models are few-shot learners
Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al. (2020) · 1901
Earlier work this paper cites.
A study of bfloat16 for deep learning training
Original
Kalamkar, D., Mudigere, D., Mellempudi, N., Das, D., Banerjee, K., Avancha, S., Vooturi, D. T., Jammalamadaka, N., Huang, J., Yuen, H., et al. (2019) · 1905
Earlier work this paper cites.
Ernie: Enhanced language representation with informative entities
Original
Zhang, Z., Han, X., Liu, Z., Jiang, X., Sun, M., and Liu, Q. (2019) · 1905
Earlier work this paper cites.
Pubmedqa: A dataset for biomedical research question answering
Original
Jin, Q., Dhingra, B., Liu, Z., Cohen, W. W., and Lu, X. (2019) · 1909
Earlier work this paper cites.
Gradient-based learning applied to document recognition
LeCun, Y., Bottou, L., Bengio, Y., and Haffner, P. (1998) · 1998
Earlier work this paper cites.
Glu variants improve transformer
Original
Shazeer, N. (2020) · 2002
Earlier work this paper cites.
Measuring massive multitask language understanding
Original
Hendrycks, D., Burns, C., Basart, S., Zou, A., Mazeika, M., Song, D., and Steinhardt, J. (2020) · 2009
Earlier work this paper cites.
Neural machine translation of rare words with subword units
Original
Sennrich, R., Haddow, B., and Birch, A. (2015) · 2015
Earlier work this paper cites.
Layer normalization
Original
Ba, J. L., Kiros, J. R., and Hinton, G. E. (2016) · 2016
Earlier work this paper cites.
Sgdr: Stochastic gradient descent with warm restarts
Original
Loshchilov, I. and Hutter, F. (2016) · 2016
Earlier work this paper cites.
Decoupled weight decay regularization
Original
Loshchilov, I. and Hutter, F. (2017) · 2017
Earlier work this paper cites.
Semi-supervised sequence tagging with bidirectional language models
Original
Peters, M. E., Ammar, W., Bhagavatula, C., and Power, R. (2017) · 2017
Earlier work this paper cites.
Attention is all you need
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., and Polosukhin, I. (2017) · 2017
Earlier work this paper cites.
Bert: Pre-training of deep bidirectional transformers for language understanding
Original
Devlin, J., Chang, M.-W., Lee, K., and Toutanova, K. (2018) · 2018
Earlier work this paper cites.
Improving language understanding by generative pre-training
Radford, A., Narasimhan, K., Salimans, T., Sutskever, I., et al. (2018) · 2018
Earlier work this paper cites.
Language models are unsupervised multitask learners
Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I., et al. (2019) · 2019
Earlier work this paper cites.
Root mean square layer normalization
Zhang, B. and Sennrich, R. (2019) · 2019
Earlier work this paper cites.
The pile: An 800gb dataset of diverse text for language modeling
Original
Gao, L., Biderman, S., Black, S., Golding, L., Hoppe, T., Foster, C., Phang, J., He, H., Thite, A., Nabeshima, N., et al. (2020) · 2020
Earlier work this paper cites.
Zero: Memory optimizations toward training trillion parameter models
Rajbhandari, S., Rasley, J., Ruwase, O., and He, Y. (2020) · 2020
Earlier work this paper cites.
Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters
Rasley, J., Rajbhandari, S., Ruwase, O., and He, Y. (2020) · 2020
Earlier work this paper cites.
Glm: General language model pretraining with autoregressive blank infilling
Original
Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., and Tang, J. (2021) · 2021
Earlier work this paper cites.
Lifelong pretraining: Continually adapting language models to emerging corpora
Original
Jin, X., Zhang, D., Zhu, H., Xiao, W., Li, S.-W., Wei, X., Arnold, A., and Ren, X. (2021) · 2021
Earlier work this paper cites.
Train short, test long: Attention with linear biases enables input length extrapolation
Original
Press, O., Smith, N. A., and Lewis, M. (2021) · 2021
Earlier work this paper cites.
Scaling language models: Methods, analysis & insights from training gopher
Original
Rae, J. W., Borgeaud, S., Cai, T., Millican, K., Hoffmann, J., Song, F., Aslanides, J., Henderson, S., Ring, R., Young, S., et al. (2021) · 2021
Earlier work this paper cites.
Roformer: Enhanced transformer with rotary position embedding
Original
Su, J., Lu, Y., Pan, S., Murtadha, A., Wen, B., and Liu, Y. (2021) · 2021
Earlier work this paper cites.