Fetching the paper…
Reading the bibliography…
Large Language Models (LLMs) are often English-centric due to the disproportionate distribution of languages in their pre-training data.
LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
Dou, S.; Zhou, E.; Liu, Y.; Gao, S.; Shen, W.; Xiong, L.; Zhou, Y.; Wang, X.; Xi, Z.; Fan, X.; Pu, S.; Zhu, J.; Zheng, R.; Gui, T.; Zhang, Q.; and Huang, X. 2024 · 1945
Earlier work this paper cites.
Scaling laws for neural language models
Kaplan, J.; McCandlish, S.; Henighan, T.; Brown, T. B.; Chess, B.; Child, R.; Gray, S.; Radford, A.; Wu, J.; and Amodei, D. 2020 · 2001
Earlier work this paper cites.
Think you have solved question answering? try arc, the ai2 reasoning challenge
Clark, P.; Cowhey, I.; Etzioni, O.; Khot, T.; Sabharwal, A.; Schoenick, C.; and Tafjord, O. 2018 · 2018
Earlier work this paper cites.
HellaSwag: Can a Machine Really Finish Your Sentence?
Zellers, R.; Holtzman, A.; Bisk, Y.; Farhadi, A.; and Choi, Y. 2019 · 2019
Earlier work this paper cites.
Measuring Massive Multitask Language Understanding
Hendrycks, D.; Burns, C.; Basart, S.; Zou, A.; Mazeika, M.; Song, D.; and Steinhardt, J. 2020 · 2020
Earlier work this paper cites.
Are All Languages Created Equal in Multilingual BERT?
Wu, S.; and Dredze, M. 2020 · 2020
Earlier work this paper cites.
LoRA: Low-Rank Adaptation of Large Language Models
Hu, E. J.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; Chen, W.; et al. 2021 · 2021
Earlier work this paper cites.
No language left behind: Scaling human-centered machine translation
Costa-jussà, M. R.; Cross, J.; Çelebi, O.; Elbayad, M.; Heafield, K.; Heffernan, K.; Kalbassi, E.; Lam, J.; Licht, D.; Maillard, J.; et al. 2022 · 2022
Earlier work this paper cites.
Flashattention: Fast and memory-efficient exact attention with io-awareness
Dao, T.; Fu, D.; Ermon, S.; Rudra, A.; and Ré, C. 2022 · 2022
Earlier work this paper cites.
Glam: Efficient scaling of language models with mixture-of-experts
Du, N.; Huang, Y.; Dai, A. M.; Tong, S.; Lepikhin, D.; Xu, Y.; Krikun, M.; Zhou, Y.; Yu, A. W.; Firat, O.; et al. 2022 · 2022
Earlier work this paper cites.
Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity
Fedus, W.; Zoph, B.; and Shazeer, N. 2022 · 2022
Earlier work this paper cites.
The flores-101 evaluation benchmark for low-resource and multilingual machine translation
Goyal, N.; Gao, C.; Chaudhary, V.; Chen, P.-J.; Wenzek, G.; Ju, D.; Krishnan, S.; Ranzato, M.; Guzmán, F.; and Fan, A. 2022 · 2022
Earlier work this paper cites.
An empirical analysis of compute-optimal large language model training
Hoffmann, J.; Borgeaud, S.; Mensch, A.; Buchatskaya, E.; Cai, T.; Rutherford, E.; de Las Casas, D.; Hendricks, L. A.; Welbl, J.; Clark, A.; et al. 2022 · 2022
Earlier work this paper cites.
Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints
Komatsuzaki, A.; Puigcerver, J.; Lee-Thorp, J.; Ruiz, C. R.; Mustafa, B.; Ainslie, J.; Tay, Y.; Dehghani, M.; and Houlsby, N. 2022 · 2022
Earlier work this paper cites.
COMET-22: Unbabel-IST 2022 submission for the metrics shared task
Rei, R.; De Souza, J. G.; Alves, D.; Zerva, C.; Farinha, A. C.; Glushkova, T.; Lavie, A.; Coheur, L.; and Martins, A. F. 2022 · 2022
Earlier work this paper cites.
Achiam, J.; Adler, S.; Agarwal, S.; Ahmad, L.; Akkaya, I.; Aleman, F. L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al. 2023 · 2023
Earlier work this paper cites.
Bai, J.; Bai, S.; Chu, Y.; Cui, Z.; Dang, K.; Deng, X.; Fan, Y.; Ge, W.; Han, Y.; Huang, F.; et al. 2023 · 2023
Cited alongside, same era.
The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants
Bandarkar, L.; Liang, D.; Muller, B.; Artetxe, M.; Shukla, S. N.; Husa, D.; Goyal, N.; Krishnan, A.; Zettlemoyer, L.; and Khabsa, M. 2023 · 2023
Cited alongside, same era.
Scaling expert language models with unsupervised domain discovery
Gururangan, S.; Li, M.; Lewis, M.; Shi, W.; Althoff, T.; Smith, N. A.; and Zettlemoyer, L. 2023 · 2023
Cited alongside, same era.
Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback
Lai, V.; Nguyen, C.; Ngo, N.; Nguyen, T.; Dernoncourt, F.; Rossi, R.; and Nguyen, T. 2023 · 2023
Cited alongside, same era.
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
Blevins, T.; Limisiewicz, T.; Gururangan, S.; Li, M.; Gonen, H.; Smith, N. A.; and Zettlemoyer, L. 2024 · 2024
Closest in time.
Sambalingo: Teaching large language models new languages
Csaki, Z.; Li, B.; Li, J.; Xu, Q.; Pawakapan, P.; Zhang, L.; Du, Y.; Zhao, H.; Hu, C.; and Thakker, U. 2024 · 2024
Closest in time.
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-AI. 2024 · 2024
Closest in time.
Dubey, A.; Jauhri, A.; Pandey, A.; Kadian, A.; Al-Dahle, A.; Letman, A.; Mathur, A.; Schelten, A.; Yang, A.; Fan, A.; et al. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Li, H.; Zhang, Y.; Koto, F.; Yang, Y.; Zhao, H.; Gong, Y.; Duan, N.; and Baldwin, T. 2023 · 2023
Cited alongside, same era.
ChatGPT (Mar 23 version) [Large language model]
OpenAI. 2023 · 2023
Cited alongside, same era.
Summarization is (almost) dead
Pu, X.; Gao, M.; and Wan, X. 2023 · 2023
Cited alongside, same era.
Leveraging Large Language Models for Multiple Choice Question Answering
Robinson, J.; and Wingate, D. 2023 · 2023
Cited alongside, same era.
SlimPajama: A 627B token cleaned and deduplicated version of RedPajama
Soboleva, D.; Al-Khateeb, F.; Myers, R.; Steeves, J. R.; Hestness, J.; and Dey, N. 2023 · 2023
Cited alongside, same era.
Llama 2: Open foundation and fine-tuned chat models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; et al. 2023 · 2023
Cited alongside, same era.
Skywork: A More Open Bilingual Foundation Model
Wei, T.; Zhao, L.; Zhang, L.; Zhu, B.; Wang, L.; Yang, H.; Li, B.; Cheng, C.; Lü, W.; Hu, R.; Li, C.; Yang, L.; Luo, X.; Wu, X.; Liu, L.; Cheng, W.; Cheng, P.; Zhang, J.; Zhang, X.; Lin, L.; Wang, X.; Ma, Y.; Dong, C.; Sun, Y.; Chen, Y.; Peng, Y.; Liang, X.; Yan, S.; Fang, H.; and Zhou, Y. 2023 · 2023
Cited alongside, same era.
Metamath: Bootstrap your own mathematical questions for large language models
Yu, L.; Jiang, W.; Shi, H.; Yu, J.; Liu, Z.; Zhang, Y.; Kwok, J. T.; Li, Z.; Weller, A.; and Liu, W. 2023 · 2023
Cited alongside, same era.
Gao, C.; Hu, H.; Hu, P.; Chen, J.; Li, J.; and Huang, S. 2024 · 2024
Closest in time.
Why Not Transform Chat Large Language Models to Non-English?
Geng, X.; Zhu, M.; Li, J.; Lai, Z.; Zou, W.; She, S.; Guo, J.; Zhao, X.; Li, Y.; Li, Y.; et al. 2024 · 2024
Closest in time.
Simple and Scalable Strategies to Continually Pre-train Large Language Models
Ibrahim, A.; Thérien, B.; Gupta, K.; Richter, M. L.; Anthony, Q. G.; Belilovsky, E.; Lesort, T.; and Rish, I. 2024 · 2024
Closest in time.
Jiang, A. Q.; Sablayrolles, A.; Roux, A.; Mensch, A.; Savary, B.; Bamford, C.; Chaplot, D. S.; de las Casas, D.; Hanna, E. B.; Bressand, F.; Lengyel, G.; Bour, G.; Lample, G.; Lavaud, L. R.; Saulnier, L.; Lachaux, M.-A.; Stock, P.; Subramanian, S.; Yang, S.; Antoniak, S.; Scao, T. L.; Gervet, T.; Lavril, T.; Wang, T.; Lacroix, T.; and Sayed, W. E. 2024 · 2024
Closest in time.
Teaching Llama a New Language Through Cross-Lingual Knowledge Transfer
Kuulmets, H.-A.; Purason, T.; Luhtaru, A.; and Fishel, M. 2024 · 2024
Closest in time.
mixtral 8*22b
Mixtral. 2024 · 2024
Closest in time.
CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages
Nguyen, T.; Nguyen, C. V.; Lai, V. D.; Man, H.; Ngo, N. T.; Dernoncourt, F.; Rossi, R. A.; and Nguyen, T. H. 2024 · 2024
Closest in time.
Snowflake Arctic: The Best LLM for Enterprise AI — Efficiently Intelligent, Truly Open
Research, S. A. 2024 · 2024
Closest in time.
SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning
Wang, B.; Liu, Z.; Huang, X.; Jiao, F.; Ding, Y.; Aw, A. T.; and Chen, N. F. 2024 · 2024
Closest in time.
LLaMA Pro: Progressive LLaMA with Block Expansion
Wu, C.; Gan, Y.; Ge, Y.; Lu, Z.; Wang, J.; Feng, Y.; Shan, Y.; and Luo, P. 2024 · 2024
Closest in time.
A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models
Xu, H.; Kim, Y. J.; Sharaf, A.; and Awadalla, H. H. 2024 · 2024
Closest in time.