Fetching the paper…
Reading the bibliography…
In today's era, where large language models (LLMs) are integrated into numerous real-world applications, ensuring their safety and robustness is crucial for responsible AI usage.
BLEU: a Method for Automatic Evaluation of Machine Translation
Papineni, K.; Roukos, S.; Ward, T.; and jing Zhu, W. 2002 · 2002
Earlier work this paper cites.
Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
Ganguli, D.; Lovitt, L.; Kernion, J.; Askell, A.; Bai, Y.; Kadavath, S.; Mann, B.; Perez, E.; Schiefer, N.; Ndousse, K.; Jones, A.; Bowman, S.; Chen, A.; Conerly, T.; DasSarma, N.; Drain, D.; Elhage, N.; El-Showk, S.; Fort, S.; Hatfield-Dodds, Z.; Henighan, T.; Hernandez, D.; Hume, T.; Jacobson, J.; Johnston, S.; Kravec, S.; Olsson, C.; Ringer, S.; Tran-Johnson, E.; Amodei, D.; Brown, T.; Joseph, N.; McCandlish, S.; Olah, C.; Kaplan, J.; and Clark, J. 2022 · 2022
Earlier work this paper cites.
Improving alignment of dialogue agents via targeted human judgements
Glaese, A.; McAleese, N.; Trebacz, M.; Aslanides, J.; Firoiu, V.; Ewalds, T.; Rauh, M.; Weidinger, L.; Chadwick, M.; Thacker, P.; Campbell-Gillingham, L.; Uesato, J.; Huang, P.-S.; Comanescu, R.; Yang, F.; See, A.; Dathathri, S.; Greig, R.; Chen, C.; Fritz, D.; Elias, J. S.; Green, R.; Mokrá, S.; Fernando, N.; Wu, B.; Foley, R.; Young, S.; Gabriel, I.; Isaac, W.; Mellor, J.; Hassabis, D.; Kavukcuoglu, K.; Hendricks, L. A.; and Irving, G. 2022 · 2022
Earlier work this paper cites.
Red Teaming Language Models with Language Models
Perez, E.; Huang, S.; Song, F.; Cai, T.; Ring, R.; Aslanides, J.; Glaese, A.; McAleese, N.; and Irving, G. 2022 · 2022
Earlier work this paper cites.
Sparks of Artificial General Intelligence: Early experiments with GPT-4
Bubeck, S.; Chandrasekaran, V.; Eldan, R.; Gehrke, J.; Horvitz, E.; Kamar, E.; Lee, P.; Lee, Y. T.; Li, Y.; Lundberg, S.; Nori, H.; Palangi, H.; Ribeiro, M. T.; and Zhang, Y. 2023 · 2023
Earlier work this paper cites.
MART: Improving LLM Safety with Multi-round Automatic Red-Teaming
Ge, S.; Zhou, C.; Hou, R.; Khabsa, M.; Wang, Y.-C.; Wang, Q.; Han, J.; and Mao, Y. 2023 · 2023
Earlier work this paper cites.
LLaMA Factory
hiyouga. 2023 · 2023
Earlier work this paper cites.
Jiang, A. Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D. S.; de las Casas, D.; Bressand, F.; Lengyel, G.; Lample, G.; Saulnier, L.; Lavaud, L. R.; Lachaux, M.-A.; Stock, P.; Scao, T. L.; Lavril, T.; Wang, T.; Lacroix, T.; and Sayed, W. E. 2023 · 2023
Cited alongside, same era.
Llama 2: Open Foundation and Fine-Tuned Chat Models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; Bikel, D.; Blecher, L.; Ferrer, C. C.; Chen, M.; Cucurull, G.; Esiobu, D.; Fernandes, J.; Fu, J.; Fu, W.; Fuller, B.; Gao, C.; Goswami, V.; Goyal, N.; Hartshorn, A.; Hosseini, S.; Hou, R.; Inan, H.; Kardas, M.; Kerkez, V.; Khabsa, M.; Kloumann, I.; Korenev, A.; Koura, P. S.; Lachaux, M.-A.; Lavril, T.; Lee, J.; Liskovich, D.; Lu, Y.; Mao, Y.; Martinet, X.; Mihaylov, T.; Mishra, P.; Molybog, I.; Nie, Y.; Poulton, A.; Reizenstein, J.; Rungta, R.; Saladi, K.; Schelten, A.; Silva, R.; Smith, E. M.; Subramanian, R.; Tan, X. E.; Tang, B.; Taylor, R.; Williams, A.; Kuan, J. X.; Xu, P.; Yan, Z.; Zarov, I.; Zhang, Y.; Fan, A.; Kambadur, M.; Narang, S.; Rodriguez, A.; Stojnic, R.; Edunov, S.; and Scialom, T. 2023 · 2023
Cited alongside, same era.
Llama 3 Model Card
AI@Meta. 2024 · 2024
Cited alongside, same era.
Many-shot jailbreaking
Anil, C.; Durmus, E.; Sharma, M.; Benton, J.; Kundu, S.; Batson, J.; Rimsky, N.; Tong, M.; Mu, J.; Ford, D.; et al. 2024 · 2024
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
Liu, X.; Xu, N.; Chen, M.; and Xiao, C. 2024 · 2024
Closest in time.
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
Mehrotra, A.; Zampetakis, M.; Kassianik, P.; Nelson, B.; Anderson, H.; Singer, Y.; and Karbasi, A. 2024 · 2024
Closest in time.
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
Samvelyan, M.; Raparthy, S. C.; Lupu, A.; Hambro, E.; Markosyan, A. H.; Bhatt, M.; Mao, Y.; Jiang, M.; Parker-Holder, J.; Foerster, J.; Rocktäschel, T.; and Raileanu, R. 2024 · 2024
Closest in time.
Meta Llama Guard 2
Team, L. 2024 · 2024
Closest in time.
Introducing v0.5 of the AI Safety Benchmark from MLCommons
Vidgen, B.; Agrawal, A.; Ahmed, A. M.; Akinwande, V.; Al-Nuaimi, N.; Alfaraj, N.; Alhajjar, E.; Aroyo, L.; Bavalatti, T.; Bartolo, M.; Blili-Hamelin, B.; Bollacker, K.; Bomassani, R.; Boston, M. F.; Campos, S.; Chakra, K.; Chen, C.; Coleman, C.; Coudert, Z. D.; Derczynski, L.; Dutta, D.; Eisenberg, I.; Ezick, J.; Frase, H.; Fuller, B.; Gandikota, R.; Gangavarapu, A.; Gangavarapu, A.; Gealy, J.; Ghosh, R.; Goel, J.; Gohar, U.; Goswami, S.; Hale, S. A.; Hutiri, W.; Imperial, J. M.; Jandial, S.; Judd, N.; Juefei-Xu, F.; Khomh, F.; Kailkhura, B.; Kirk, H. R.; Klyman, K.; Knotz, C.; Kuchnik, M.; Kumar, S. H.; Kumar, S.; Lengerich, C.; Li, B.; Liao, Z.; Long, E. P.; Lu, V.; Luger, S.; Mai, Y.; Mammen, P. M.; Manyeki, K.; McGregor, S.; Mehta, V.; Mohammed, S.; Moss, E.; Nachman, L.; Naganna, D. J.; Nikanjam, A.; Nushi, B.; Oala, L.; Orr, I.; Parrish, A.; Patlak, C.; Pietri, W.; Poursabzi-Sangdeh, F.; Presani, E.; Puletti, F.; Röttger, P.; Sahay, S.; Santos, T.; Scherrer, N.; Sebag, A. S.; Schramowski, P.; Shahbazi, A.; Sharma, V.; Shen, X.; Sistla, V.; Tang, L.; Testuggine, D.; Thangarasa, V.; Watkins, E. A.; Weiss, R.; Welty, C.; Wilbers, T.; Williams, A.; Wu, C.-J.; Yadav, P.; Yang, X.; Zeng, Y.; Zhang, W.; Zhdanov, F.; Zhu, J.; Liang, P.; Mattson, P.; and Vanschoren, J. 2024 · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Jailbreaking Black Box Large Language Models in Twenty Queries
Chao, P.; Robey, A.; Dobriban, E.; Hassani, H.; Pappas, G. J.; and Wong, E. 2024 · 2024
Cited alongside, same era.
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
Han, V. T. Y.; Bhardwaj, R.; and Poria, S. 2024 · 2024
Cited alongside, same era.
DART: Deep Adversarial Automated Red Teaming for LLM Safety
Jiang, B.; Jing, Y.; Shen, T.; Yang, Q.; and Xiong, D. 2024a
Cited in the paper.
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
Jiang, F.; Xu, Z.; Niu, L.; Xiang, Z.; Ramasubramanian, B.; Li, B.; and Poovendran, R. 2024b
Cited in the paper.
Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation
Shah, R.; Feuillade-Montixi, Q.; Pour, S.; Tagade, A.; Casper, S.; and Rando, J. 2023a
Cited in the paper.
Scalable and transferable black-box jailbreaks for language models via persona modulation
Shah, R.; Pour, S.; Tagade, A.; Casper, S.; Rando, J.; et al. 2023b
Cited in the paper.
Closest in time.
Low-Resource Languages Jailbreak GPT-4
Yong, Z.-X.; Menghini, C.; and Bach, S. H. 2024 · 2024
Closest in time.