Fetching the paper…
Reading the bibliography…
This paper explores the feasibility and performance of on-device large language model (LLM) inference on various Apple iPhone models.
Distilling the Knowledge in a Neural Network, March 2015
Geoffrey Hinton, Oriol Vinyals, and Jeff Dean · 2015
Earlier work this paper cites.
Sequence-Level Knowledge Distillation, September 2016
Yoon Kim and Alexander M. Rush · 2016
Earlier work this paper cites.
Serverless computing: a security perspective
Eduard Marin, Diego Perino, and Roberto Di Pietro · 2022
Earlier work this paper cites.
Yukun Huang, Yanda Chen, Zhou Yu, and Kathleen McKeown · 2022
Earlier work this paper cites.
8-bit Numerical Formats for Deep Neural Networks, June 2022
Badreddine Noune, Philip Jones, Daniel Justus, Dominic Masters, and Carlo Luschi · 2022
Earlier work this paper cites.
LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale, November 2022
Tim Dettmers, Mike Lewis, Younes Belkada, and Luke Zettlemoyer · 2022
Earlier work this paper cites.
Open llm leaderboard
Edward Beeching, Clementine Fourrier, Nathan Habib, Sheon Han, Nathan Lambert, Nazneen Rajani, Omar Sanseviero, Lewis Tunstall, and Thomas Wolf · 2023
Cited alongside, same era.
Teaching Small Language Models to Reason, June 2023
Lucie Charlotte Magister, Jonathan Mallinson, Jakub Adamek, Eric Malmi, and Aliaksei Severyn · 2023
Cited alongside, same era.
Knowledge Distillation of Large Language Models, June 2023
Yuxian Gu, Li Dong, Furu Wei, and Minlie Huang · 2023
Cited alongside, same era.
A Survey on Model Compression for Large Language Models, September 2023
Xunyu Zhu, Jian Li, Yong Liu, Can Ma, and Weiping Wang · 2023
Cited alongside, same era.
SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot, March 2023
A Simple and Effective Pruning Approach for Large Language Models, October 2023
Mingjie Sun, Zhuang Liu, Anna Bair, and J. Zico Kolter · 2023
Closest in time.
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models, August 2023
Wenqi Shao, Mengzhao Chen, Zhaoyang Zhang, Peng Xu, Lirui Zhao, Zhiqian Li, Kaipeng Zhang, Peng Gao, Yu Qiao, and Ping Luo · 2023
Closest in time.
orca mini v3 7b: An explain tuned llama2-7b model, 2023
Pankaj Mathur · 2023
Closest in time.
Orca: Progressive learning from complex explanation traces of gpt-4, 2023
Subhabrata Mukherjee, Arindam Mitra, Ganesh Jawahar, Sahaj Agarwal, Hamid Palangi, and Ahmed Awadallah · 2023
Closest in time.
llama.cpp b1407
Georgi Gergenov · 2023
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Elias Frantar and Dan Alistarh · 2023
Cited alongside, same era.
Llama 2: Open foundation and fine-tuned chat models, 2023
Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Dan Bikel, Lukas Blecher, Cristian Canton Ferrer, Moya Chen, Guillem Cucurull, David Esiobu, Jude Fernandes, Jeremy Fu, Wenyin Fu, Brian Fuller, Cynthia Gao, Vedanuj Goswami, Naman Goyal, Anthony Hartshorn, Saghar Hosseini, Rui Hou, Hakan Inan, Marcin Kardas, Viktor Kerkez, Madian Khabsa, Isabel Kloumann, Artem Korenev, Punit Singh Koura, Marie-Anne Lachaux, Thibaut Lavril, Jenya Lee, Diana Liskovich, Yinghai Lu, Yuning Mao, Xavier Martinet, Todor Mihaylov, Pushkar Mishra, Igor Molybog, Yixin Nie, Andrew Poulton, Jeremy Reizenstein, Rashi Rungta, Kalyan Saladi, Alan Schelten, Ruan Silva, Eric Michael Smith, Ranjan Subramanian, Xiaoqing Ellen Tan, Binh Tang, Ross Taylor, Adina Williams, Jian Xiang Kuan, Puxin Xu, Zheng Yan, Iliyan Zarov, Yuchen Zhang, Angela Fan, Melanie Kambadur, Sharan Narang, Aurelien Rodriguez, Robert Stojnic, Sergey Edunov, and Thomas Scialom
Cited in the paper.