Fetching the paper…
Reading the bibliography…
Large language models (LLMs) and small language models (SLMs) are being adopted at remarkable speed, although their safety still remains a serious concern.
Racial Bias in Hate Speech and Abusive Language Detection Datasets
Davidson, T.; Bhattacharya, D.; and Weber, I. 2019 · 2019
Earlier work this paper cites.
The Risk of Racial Bias in Hate Speech Detection
Sap, M.; Card, D.; Gabriel, S.; Choi, Y.; and Smith, N. A. 2019 · 2019
Earlier work this paper cites.
The Woman Worked as a Babysitter: On Biases in Language Generation
Sheng, E.; Chang, K.-W.; Natarajan, P.; and Peng, N. 2019 · 2019
Earlier work this paper cites.
RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models
Gehman, S.; Gururangan, S.; Sap, M.; Choi, Y.; and Smith, N. A. 2020 · 2020
Earlier work this paper cites.
The State and Fate of Linguistic Diversity and Inclusion in the NLP World
Joshi, P.; Santy, S.; Budhiraja, A.; Bali, K.; and Choudhury, M. 2020 · 2020
Earlier work this paper cites.
Toxic Language Detection in Social Media for Brazilian Portuguese: New Dataset and Multilingual Analysis
Leite, J. A.; Silva, D. F.; Bontcheva, K.; and Scarton, C. 2020 · 2020
Earlier work this paper cites.
BEEP! Korean Corpus of Online News Comments for Toxic Speech Detection
Moon, J.; Cho, W. I.; and Lee, J. 2020 · 2020
Earlier work this paper cites.
Offensive Language and Hate Speech Detection for Danish
Sigurbergsson, G. I.; and Derczynski, L. 2020 · 2020
Earlier work this paper cites.
Multi-task Learning for Multilingual Neural Machine Translation
Wang, Y.; Zhai, C.; and Hassan, H. 2020 · 2020
Earlier work this paper cites.
BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation
Dhamala, J.; Sun, T.; Kumar, V.; Krishna, S.; Pruksachatkun, Y.; Chang, K.-W.; and Gupta, R. 2021 · 2021
Earlier work this paper cites.
No Language Left Behind: Scaling Human-Centered Machine Translation
Costa-jussà, M. R.; Cross, J.; Çelebi, O.; Elbayad, M.; Heafield, K.; Heffernan, K.; Kalbassi, E.; Lam, J.; Licht, D.; Maillard, J.; Sun, A.; Wang, S.; Wenzek, G.; Youngblood, A.; Akula, B.; Barrault, L.; Gonzalez, G. M.; Hansanti, P.; Hoffman, J.; Jarrett, S.; Sadagopan, K. R.; Rowe, D.; Spruit, S.; Tran, C.; Andrews, P.; Ayan, N. F.; Bhosale, S.; Edunov, S.; Fan, A.; Gao, C.; Goswami, V.; Guzmán, F.; Koehn, P.; Mourachko, A.; Ropers, C.; Saleem, S.; Schwenk, H.; and Wang, J. 2022 · 2022
Earlier work this paper cites.
ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection
Hartvigsen, T.; Gabriel, S.; Palangi, H.; Sap, M.; Ray, D.; and Kamar, E. 2022 · 2022
Earlier work this paper cites.
Characteristics of harmful text: Towards rigorous benchmarking of language models
Rauh, M.; Mellor, J.; Uesato, J.; Huang, P.-S.; Welbl, J.; Weidinger, L.; Dathathri, S.; Glaese, A.; Irving, G.; Gabriel, I.; Isaac, W.; and Hendricks, L. A. 2022 · 2022
Earlier work this paper cites.
Quantifying Memorization Across Neural Language Models
Carlini, N.; Ippolito, D.; Jagielski, M.; Lee, K.; Tramer, F.; and Zhang, C. 2023 · 2023
Cited alongside, same era.
An evaluation on large language model outputs: Discourse and memorization
De Wynter, A.; Wang, X.; Sokolov, A.; Gu, Q.; and Chen, S.-Q. 2023 · 2023
Cited alongside, same era.
Offensive Hebrew Corpus and Detection using BERT
Hamad, N.; Jarrar, M.; Khalilia, M.; and Nashif, N. 2023 · 2023
Cited alongside, same era.
Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
Inan, H.; Upasani, K.; Chi, J.; Rungta, R.; Iyer, K.; Mao, Y.; Tontchev, M.; Hu, Q.; Fuller, B.; Testuggine, D.; and Khabsa, M. 2023 · 2023
Cited alongside, same era.
Mistral 7B
Jiang, A. Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D. S.; de las Casas, D.; Bressand, F.; Lengyel, G.; Lample, G.; Saulnier, L.; Lavaud, L. R.; Lachaux, M.-A.; Stock, P.; Scao, T. L.; Lavril, T.; Wang, T.; Lacroix, T.; and Sayed, W. E. 2023 · 2023
Cited alongside, same era.
Llama 3 Model Card
AI@Meta. 2024 · 2024
Closest in time.
A Survey on Evaluation of Large Language Models
Chang, Y.; Wang, X.; Wang, J.; Wu, Y.; Yang, L.; Zhu, K.; Chen, H.; Yi, X.; Wang, C.; Wang, Y.; Ye, W.; Zhang, Y.; Chang, Y.; Yu, P. S.; Yang, Q.; and Xie, X. 2024 · 2024
Closest in time.
Multilingual Jailbreak Challenges in Large Language Models
Deng, Y.; Zhang, W.; Pan, S. J.; and Bing, L. 2024 · 2024
Closest in time.
Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?
Hada, R.; Gumma, V.; de Wynter, A.; Diddee, H.; Ahmed, M.; Choudhury, M.; Bali, K.; and Sitaram, S. 2024 · 2024
Closest in time.
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ
Holtermann, C.; Röttger, P.; Dill, T.; and Lauscher, A. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
ChatGPT Beyond English: Towards a Comprehensive Evaluation of Large Language Models in Multilingual Learning
Lai, V.; Ngo, N.; Pouran Ben Veyseh, A.; Man, H.; Dernoncourt, F.; Bui, T.; and Nguyen, T. 2023a · 2023
Cited alongside, same era.
ChatGPT Beyond English: Towards a Comprehensive Evaluation of Large Language Models in Multilingual Learning
Lai, V. D.; Ngo, N. T.; Veyseh, A. P. B.; Man, H.; Dernoncourt, F.; Bui, T.; and Nguyen, T. H. 2023b · 2023
Cited alongside, same era.
Do Language Models Plagiarize?
Lee, J.; Le, T.; Chen, J.; and Lee, D. 2023 · 2023
Cited alongside, same era.
Llama 2: Open Foundation and Fine-Tuned Chat Models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; Bikel, D.; Blecher, L.; Ferrer, C. C.; Chen, M.; Cucurull, G.; Esiobu, D.; Fernandes, J.; Fu, J.; Fu, W.; Fuller, B.; Gao, C.; Goswami, V.; Goyal, N.; Hartshorn, A.; Hosseini, S.; Hou, R.; Inan, H.; Kardas, M.; Kerkez, V.; Khabsa, M.; Kloumann, I.; Korenev, A.; Koura, P. S.; Lachaux, M.-A.; Lavril, T.; Lee, J.; Liskovich, D.; Lu, Y.; Mao, Y.; Martinet, X.; Mihaylov, T.; Mishra, P.; Molybog, I.; Nie, Y.; Poulton, A.; Reizenstein, J.; Rungta, R.; Saladi, K.; Schelten, A.; Silva, R.; Smith, E. M.; Subramanian, R.; Tan, X. E.; Tang, B.; Taylor, R.; Williams, A.; Kuan, J. X.; Xu, P.; Yan, Z.; Zarov, I.; Zhang, Y.; Fan, A.; Kambadur, M.; Narang, S.; Rodriguez, A.; Stojnic, R.; Edunov, S.; and Scialom, T. 2023 · 2023
Cited alongside, same era.
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
Wang, B.; Chen, W.; Pei, H.; Xie, C.; Kang, M.; Zhang, C.; Xu, C.; Xiong, Z.; Dutta, R.; Schaeffer, R.; Truong, S. T.; Arora, S.; Mazeika, M.; Hendrycks, D.; Lin, Z.; Cheng, Y.; Koyejo, S.; Song, D.; and Li, B. 2023 · 2023
Cited alongside, same era.
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Zheng, L.; Chiang, W.-L.; Sheng, Y.; Zhuang, S.; Wu, Z.; Zhuang, Y.; Lin, Z.; Li, Z.; Li, D.; Xing, E.; Zhang, H.; Gonzalez, J. E.; and Stoica, I. 2023 · 2023
Cited alongside, same era.
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
Ahuja, S.; Aggarwal, D.; Gumma, V.; Watts, I.; Sathe, A.; Ochieng, M.; Hada, R.; Jain, P.; Ahmed, M.; Bali, K.; and Sitaram, S. 2024 · 2024
Cited alongside, same era.
Jain, D.; Kumar, P.; Gehman, S.; Zhou, X.; Hartvigsen, T.; and Sap, M. 2024 · 2024
Closest in time.
How Well Do LLMs Identify Cultural Unity in Diversity?
Li, J.; Wang, J.; Hu, J.; and Jiang, M. 2024 · 2024
Closest in time.
OpenAI. 2024 · 2024
Closest in time.
Gemma: Open Models Based on Gemini Research and Technology
Team, G.; Mesnard, T.; Hardin, C.; Dadashi, R.; Bhupatiraju, S.; Pathak, S.; Sifre, L.; Rivière, M.; Kale, M. S.; Love, J.; Tafti, P.; Hussenot, L.; Sessa, P. G.; Chowdhery, A.; Roberts, A.; Barua, A.; Botev, A.; Castro-Ros, A.; Slone, A.; Héliou, A.; Tacchetti, A.; Bulanova, A.; Paterson, A.; Tsai, B.; Shahriari, B.; Lan, C. L.; Choquette-Choo, C. A.; Crepy, C.; Cer, D.; Ippolito, D.; Reid, D.; Buchatskaya, E.; Ni, E.; Noland, E.; Yan, G.; Tucker, G.; Muraru, G.-C.; Rozhdestvenskiy, G.; Michalewski, H.; Tenney, I.; Grishchenko, I.; Austin, J.; Keeling, J.; Labanowski, J.; Lespiau, J.-B.; Stanway, J.; Brennan, J.; Chen, J.; Ferret, J.; Chiu, J.; Mao-Jones, J.; Lee, K.; Yu, K.; Millican, K.; Sjoesund, L. L.; Lee, L.; Dixon, L.; Reid, M.; Mikuła, M.; Wirth, M.; Sharman, M.; Chinaev, N.; Thain, N.; Bachem, O.; Chang, O.; Wahltinez, O.; Bailey, P.; Michel, P.; Yotov, P.; Chaabouni, R.; Comanescu, R.; Jana, R.; Anil, R.; McIlroy, R.; Liu, R.; Mullins, R.; Smith, S. L.; Borgeaud, S.; Girgin, S.; Douglas, S.; Pandya, S.; Shakeri, S.; De, S.; Klimenko, T.; Hennigan, T.; Feinberg, V.; Stokowiec, W.; hui Chen, Y.; Ahmed, Z.; Gong, Z.; Warkentin, T.; Peran, L.; Giang, M.; Farabet, C.; Vinyals, O.; Dean, J.; Kavukcuoglu, K.; Hassabis, D.; Ghahramani, Z.; and et al., D. E. 2024 · 2024
Closest in time.
All Languages Matter: On the Multilingual Safety of LLMs
Wang, W.; Tu, Z.; Chen, C.; Yuan, Y.; Huang, J.-t.; Jiao, W.; and Lyu, M. 2024a · 2024
Closest in time.
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
Wang, Y.; Zhai, Z.; Li, H.; Han, X.; Lin, S.; Zhang, Z.; Zhao, A.; Nakov, P.; and Baldwin, T. 2024b · 2024
Closest in time.
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
Wei, F.; Chen, X.; and Luo, L. 2024 · 2024
Closest in time.