Fetching the paper…
Reading the bibliography…
In this study, we tackle a growing concern around the safety and ethical use of large language models (LLMs).
Proximal Policy Optimization Algorithms
Schulman, J.; Wolski, F.; Dhariwal, P.; Radford, A.; and Klimov, O. 2017 · 2017
Earlier work this paper cites.
HellaSwag: Can a Machine Really Finish Your Sentence?
Zellers, R.; Holtzman, A.; Bisk, Y.; Farhadi, A.; and Choi, Y. 2019 · 2019
Earlier work this paper cites.
Artificial Intelligence, Values, and Alignment
Gabriel, I. 2020 · 2020
Earlier work this paper cites.
Editing Factual Knowledge in Language Models
Cao, N. D.; Aziz, W.; and Titov, I. 2021 · 2021
Earlier work this paper cites.
Measuring Massive Multitask Language Understanding
Hendrycks, D.; Burns, C.; Basart, S.; Zou, A.; Mazeika, M.; Song, D.; and Steinhardt, J. 2021 · 2021
Earlier work this paper cites.
On the Opportunities and Risks of Foundation Models
Bommasani, R.; Hudson, D. A.; Adeli, E.; Altman, R.; Arora, S.; von Arx, S.; Bernstein, M. S.; Bohg, J.; Bosselut, A.; Brunskill, E.; Brynjolfsson, E.; Buch, S.; Card, D.; Castellon, R.; Chatterji, N.; Chen, A.; Creel, K.; Davis, J. Q.; Demszky, D.; Donahue, C.; Doumbouya, M.; Durmus, E.; Ermon, S.; Etchemendy, J.; Ethayarajh, K.; Fei-Fei, L.; Finn, C.; Gale, T.; Gillespie, L.; Goel, K.; Goodman, N.; Grossman, S.; Guha, N.; Hashimoto, T.; Henderson, P.; Hewitt, J.; Ho, D. E.; Hong, J.; Hsu, K.; Huang, J.; Icard, T.; Jain, S.; Jurafsky, D.; Kalluri, P.; Karamcheti, S.; Keeling, G.; Khani, F.; Khattab, O.; Koh, P. W.; Krass, M.; Krishna, R.; Kuditipudi, R.; Kumar, A.; Ladhak, F.; Lee, M.; Lee, T.; Leskovec, J.; Levent, I.; Li, X. L.; Li, X.; Ma, T.; Malik, A.; Manning, C. D.; Mirchandani, S.; Mitchell, E.; Munyikwa, Z.; Nair, S.; Narayan, A.; Narayanan, D.; Newman, B.; Nie, A.; Niebles, J. C.; Nilforoshan, H.; Nyarko, J.; Ogut, G.; Orr, L.; Papadimitriou, I.; Park, J. S.; Piech, C.; Portelance, E.; Potts, C.; Raghunathan, A.; Reich, R.; Ren, H.; Rong, F.; Roohani, Y.; Ruiz, C.; Ryan, J.; Ré, C.; Sadigh, D.; Sagawa, S.; Santhanam, K.; Shih, A.; Srinivasan, K.; Tamkin, A.; Taori, R.; Thomas, A. W.; Tramèr, F.; Wang, R. E.; Wang, W.; Wu, B.; Wu, J.; Wu, Y.; Xie, S. M.; Yasunaga, M.; You, J.; Zaharia, M.; Zhang, M.; Zhang, T.; Zhang, X.; Zhang, Y.; Zheng, L.; Zhou, K.; and Liang, P. 2022 · 2022
Earlier work this paper cites.
TruthfulQA: Measuring How Models Mimic Human Falsehoods
Lin, S.; Hilton, J.; and Evans, O. 2022 · 2022
Earlier work this paper cites.
Locating and Editing Factual Associations in GPT
Meng, K.; Bau, D.; Andonian, A.; and Belinkov, Y. 2022 · 2022
Earlier work this paper cites.
Multilingual Jailbreak Challenges in Large Language Models
Deng, Y.; Zhang, W.; Pan, S. J.; and Bing, L. 2023 · 2023
Earlier work this paper cites.
Specializing Smaller Language Models towards Multi-Step Reasoning
Fu, Y.; Peng, H.; Ou, L.; Sabharwal, A.; and Khot, T. 2023 · 2023
Earlier work this paper cites.
Spear Phishing With Large Language Models
Hazell, J. 2023 · 2023
Earlier work this paper cites.
Large Language Models are Zero-Shot Reasoners
Kojima, T.; Gu, S. S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y. 2023 · 2023
Earlier work this paper cites.
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
Lapid, R.; Langberg, R.; and Sipper, M. 2023 · 2023
Earlier work this paper cites.
Lou, A.; Wang, J.; and Zhang, Y. 2023 · 2023
Cited alongside, same era.
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
Mehrotra, A.; Zampetakis, M.; Kassianik, P.; Nelson, B.; Anderson, H.; Singer, Y.; and Karbasi, A. 2023 · 2023
Cited alongside, same era.
Morris, J. X.; Zhao, W.; Chiu, J. T.; Shmatikov, V.; and Rush, A. M. 2023 · 2023
Cited alongside, same era.
Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
Qi, X.; Zeng, Y.; Xie, T.; Chen, P.-Y.; Jia, R.; Mittal, P.; and Henderson, P. 2023 · 2023
Cited alongside, same era.
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
Yan, J.; Yadav, V.; Li, S.; Chen, L.; Tang, Z.; Wang, H.; Srinivasan, V.; Ren, X.; and Jin, H. 2023 · 2023
Later among the works it cites.
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Zheng, L.; Chiang, W.-L.; Sheng, Y.; Zhuang, S.; Wu, Z.; Zhuang, Y.; Lin, Z.; Li, Z.; Li, D.; Xing, E. P.; Zhang, H.; Gonzalez, J. E.; and Stoica, I. 2023 · 2023
Later among the works it cites.
Universal and Transferable Adversarial Attacks on Aligned Language Models
Zou, A.; Wang, Z.; Carlini, N.; Nasr, M.; Kolter, J. Z.; and Fredrikson, M. 2023 · 2023
Later among the works it cites.
Fan, X.; Xiao, Q.; Zhou, X.; Pei, J.; Sap, M.; Lu, Z.; and Shen, H. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Schulhoff, S.; Pinto, J.; Khan, A.; Bouchard, L.-F.; Si, C.; Anati, S.; Tagliabue, V.; Kost, A. L.; Carnahan, C.; and Boyd-Graber, J. 2023 · 2023
Cited alongside, same era.
Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation
Shah, R.; Feuillade-Montixi, Q.; Pour, S.; Tagade, A.; Casper, S.; and Rando, J. 2023 · 2023
Cited alongside, same era.
On Second Thought, Let’s Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning
Shaikh, O.; Zhang, H.; Held, W.; Bernstein, M.; and Yang, D. 2023 · 2023
Cited alongside, same era.
On the Exploitability of Instruction Tuning
Shu, M.; Wang, J.; Zhu, C.; Geiping, J.; Xiao, C.; and Goldstein, T. 2023 · 2023
Cited alongside, same era.
Llama 2: Open Foundation and Fine-Tuned Chat Models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; Bikel, D.; Blecher, L.; Ferrer, C. C.; Chen, M.; Cucurull, G.; Esiobu, D.; Fernandes, J.; Fu, J.; Fu, W.; Fuller, B.; Gao, C.; Goswami, V.; Goyal, N.; Hartshorn, A.; Hosseini, S.; Hou, R.; Inan, H.; Kardas, M.; Kerkez, V.; Khabsa, M.; Kloumann, I.; Korenev, A.; Koura, P. S.; Lachaux, M.-A.; Lavril, T.; Lee, J.; Liskovich, D.; Lu, Y.; Mao, Y.; Martinet, X.; Mihaylov, T.; Mishra, P.; Molybog, I.; Nie, Y.; Poulton, A.; Reizenstein, J.; Rungta, R.; Saladi, K.; Schelten, A.; Silva, R.; Smith, E. M.; Subramanian, R.; Tan, X. E.; Tang, B.; Taylor, R.; Williams, A.; Kuan, J. X.; Xu, P.; Yan, Z.; Zarov, I.; Zhang, Y.; Fan, A.; Kambadur, M.; Narang, S.; Rodriguez, A.; Stojnic, R.; Edunov, S.; and Scialom, T. 2023 · 2023
Cited alongside, same era.
Poisoning Language Models During Instruction Tuning
Wan, A.; Wallace, E.; Shen, S.; and Klein, D. 2023 · 2023
Cited alongside, same era.
Jailbroken: How Does LLM Safety Training Fail?
Wei, A.; Haghtalab, N.; and Steinhardt, J. 2023 · 2023
Cited alongside, same era.
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
Wei, Z.; Wang, Y.; and Wang, Y. 2023 · 2023
Cited alongside, same era.
Hazra, R.; Layek, S.; Banerjee, S.; and Poria, S. 2024 · 2024
Closest in time.
Towards Effective Human-AI Alignment: Challenges and Solutions
Ngo, T.; Krakovna, V.; and Clark, A. 2024 · 2024
Closest in time.
Universal Jailbreak Backdoors from Poisoned Human Feedback
Rando, J.; and Tramèr, F. 2024 · 2024
Closest in time.
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
Shen, L.; Tan, W.; Chen, S.; Chen, Y.; Zhang, J.; Xu, H.; Zheng, B.; Koehn, P.; and Khashabi, D. 2024 · 2024
Closest in time.
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
Wang, B.; Chen, W.; Pei, H.; Xie, C.; Kang, M.; Zhang, C.; Xu, C.; Xiong, Z.; Dutta, R.; Schaeffer, R.; Truong, S. T.; Arora, S.; Mazeika, M.; Hendrycks, D.; Lin, Z.; Cheng, Y.; Koyejo, S.; Song, D.; and Li, B. 2024 · 2024
Closest in time.
Fundamental Limitations of Alignment in Large Language Models
Wolf, Y.; Wies, N.; Avnery, O.; Levine, Y.; and Shashua, A. 2024 · 2024
Closest in time.
Zeng, Y.; Lin, H.; Zhang, J.; Yang, D.; Jia, R.; and Shi, W. 2024 · 2024
Closest in time.
Weak-to-Strong Jailbreaking on Large Language Models
Zhao, X.; Yang, X.; Pang, T.; Du, C.; Li, L.; Wang, Y.-X.; and Wang, W. Y. 2024 · 2024
Closest in time.
AutoDAN: Automatic and Interpretable Adversarial Attacks on Large Language Models
Zhu, S.; Zhang, R.; An, B.; Wu, G.; Barrow, J.; Huang, F.; and Sun, T. 2024 · 2024
Closest in time.