Pipedream: generalized pipeline parallelism for dnn training
Narayanan, D., Harlap, A., Phanishayee, A., Seshadri, V., Devanur, N. R., Ganger, G. R., Gibbons, P. B., and Zaharia, M · 2019
Cited alongside, same era.
Exploring the limits of transfer learning with a unified text-to-text transformer
Original
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., and Liu, P. J · 2019
Cited alongside, same era.
Regularized evolution for image classifier architecture search
Real, E., Aggarwal, A., Huang, Y., and Le, Q. V · 2019
Cited alongside, same era.
Megatron-lm: Training multi-billion parameter language models using model parallelism
Original
Shoeybi, M., Patwary, M., Puri, R., LeGresley, P., Casper, J., and Catanzaro, B · 2019
Cited alongside, same era.
Language models are few-shot learners
Original
Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al · 2020
Cited alongside, same era.
Realm: Retrieval-augmented language model pre-training
Original
Guu, K., Lee, K., Tung, Z., Pasupat, P., and Chang, M.-W · 2020
Cited alongside, same era.
Gshard: Scaling giant models with conditional computation and automatic sharding
Original
Lepikhin, D., Lee, H., Xu, Y., Chen, D., Firat, O., Huang, Y., Krikun, M., Shazeer, N., and Chen, Z · 2020
Cited alongside, same era.
Retrieval-augmented generation for knowledge-intensive nlp tasks
Original
Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W.-t., Rocktäschel, T., et al · 2020
Cited alongside, same era.
Zero: Memory optimizations toward training trillion parameter models
Rajbhandari, S., Rasley, J., Ruwase, O., and He, Y · 2020
Cited alongside, same era.
Sequence parallelism: Making 4d parallelism possible
Original
Li, S., Xue, F., Li, Y., and You, Y
Cited in the paper.
Terapipe: Token-level pipeline parallelism for training large-scale language models
Original
Li, Z., Zhuang, S., Guo, S., Zhuo, D., Zhang, H., Song, D., and Stoica, I
Cited in the paper.
Memory-efficient pipeline-parallel dnn training
Narayanan, D., Phanishayee, A., Shi, K., Chen, X., and Zaharia, M
Cited in the paper.