Language models are few-shot learners
T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al · 2020
Cited alongside, same era.
Winogrande: An adversarial winograd schema challenge at scale
K. Sakaguchi, R. L. Bras, C. Bhagavatula, and Y. Choi · 2021
Cited alongside, same era.
Llm. int8 (): 8-bit matrix multiplication for transformers at scale
Original
T. Dettmers, M. Lewis, Y. Belkada, and L. Zettlemoyer · 2022
Cited alongside, same era.
Gptq: Accurate post-training quantization for generative pre-trained transformers
Original
E. Frantar, S. Ashkboos, T. Hoefler, and D. Alistarh · 2022
Cited alongside, same era.
Fp8 quantization: The power of the exponent
A. Kuzmin, M. Van Baalen, Y. Ren, M. Nagel, J. Peters, and T. Blankevoort · 2022
Cited alongside, same era.
Fp8 formats for deep learning
Original
P. Micikevicius, D. Stosic, N. Burgess, M. Cornea, P. Dubey, R. Grisenthwaite, S. Ha, A. Heinecke, P. Judd, J. Kamalu, et al · 2022
Cited alongside, same era.
Opt: Open pre-trained transformer language models
Original
S. Zhang, S. Roller, N. Goyal, M. Artetxe, M. Chen, S. Chen, C. Dewan, M. Diab, X. Li, X. V. Lin, et al · 2022
Cited alongside, same era.
Qlora: Efficient finetuning of quantized llms
Original
T. Dettmers, A. Pagnoni, A. Holtzman, and L. Zettlemoyer · 2023
Cited alongside, same era.
Teq: Trainable equivalent transformation for quantization of llms
Original
W. Cheng, Y. Cai, K. Lv, and H. Shen
Cited in the paper.
Optimize weight rounding via signed gradient descent for the quantization of llms
Original
W. Cheng, W. Zhang, H. Shen, Y. Cai, X. He, and K. Lv
Cited in the paper.
Llama: Open and efficient foundation language models
Original
H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozière, N. Goyal, E. Hambro, F. Azhar, et al
Cited in the paper.
Llama 2: Open foundation and fine-tuned chat models
Original
H. Touvron, L. Martin, K. Stone, P. Albert, A. Almahairi, Y. Babaei, N. Bashlykov, S. Batra, P. Bhargava, S. Bhosale, et al
Cited in the paper.