Fetching the paper…
Reading the bibliography…
Defending large language models against jailbreaks so that they never engage in a broadly-defined set of forbidden behaviors is an open problem.
Checklist manifesto, the (HB)
A. Gawande · 2010
Earlier work this paper cites.
Unrestricted adversarial examples, 2018
T. B. Brown, N. Carlini, C. Zhang, C. Olsson, P. Christiano, and I. Goodfellow · 2018
Earlier work this paper cites.
Adversarial glue: A multi-task benchmark for robustness evaluation of language models
B. Wang, C. Xu, S. Wang, Z. Gan, Y. Cheng, J. Gao, A. H. Awadallah, and B. Li · 2021
Earlier work this paper cites.
Constitutional ai: Harmlessness from ai feedback, 2022
Y. Bai, S. Kadavath, S. Kundu, et al · 2022
Earlier work this paper cites.
Training language models to follow instructions with human feedback, 2022
L. Ouyang, J. Wu, X. Jiang, et al · 2022
Earlier work this paper cites.
Adversarial training for high-stakes reliability, 2022
D. M. Ziegler, S. Nix, L. Chan, T. Bauman, P. Schmidt-Nielsen, T. Lin, A. Scherlis, N. Nabeshima, B. Weinstein-Raun, D. de Haas, B. Shlegeris, and N. Thomas · 2022
Earlier work this paper cites.
Improving alignment and robustness with circuit breakers, 2024
A. Zou, L. Phan, J. Wang, D. Duenas, M. Lin, M. Andriushchenko, R. Wang, Z. Kolter, M. Fredrikson, and D. Hendrycks · 2022
Earlier work this paper cites.
Detecting language model attacks with perplexity, 2023
G. Alon and M. Kamfonas · 2023
Earlier work this paper cites.
Jailbreaking black box large language models in twenty queries, 2023
P. Chao, A. Robey, E. Dobriban, H. Hassani, G. J. Pappas, and E. Wong · 2023
Earlier work this paper cites.
Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023
H. Inan, K. Upasani, J. Chi, et al · 2023
Earlier work this paper cites.
Mistral 7b, 2023
A. Q. Jiang, A. Sablayrolles, A. Mensch, et al · 2023
Earlier work this paper cites.
Automatically auditing large language models via discrete optimization
E. Jones, A. Dragan, A. Raghunathan, and J. Steinhardt · 2023
Earlier work this paper cites.
Alpacaeval: An automatic evaluator of instruction-following models
X. Li, T. Zhang, Y. Dubois, R. Taori, I. Gulrajani, C. Guestrin, P. Liang, and T. B. Hashimoto · 2023
Earlier work this paper cites.
Smoothllm: Defending large language models against jailbreaking attacks, 2023
A. Robey, E. Wong, H. Hassani, and G. J. Pappas · 2023
Cited alongside, same era.
Llama 2: Open foundation and fine-tuned chat models, 2023
H. Touvron, L. Martin, K. Stone, et al · 2023
Cited alongside, same era.
Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts
J. Yu, X. Lin, and X. Xing · 2023
Cited alongside, same era.
Universal and transferable adversarial attacks on aligned language models, 2023
A. Zou, Z. Wang, N. Carlini, M. Nasr, J. Z. Kolter, and M. Fredrikson · 2023
Cited alongside, same era.
Jailbreaking leading safety-aligned llms with simple adaptive attacks, 2024
M. Andriushchenko, F. Croce, and N. Flammarion · 2024
Cited alongside, same era.
Many-shot jailbreaking
Prp: Propagating universal perturbations to attack large language model guard-rails, 2024
N. Mangaokar, A. Hooda, J. Choi, S. Chandrashekaran, K. Fawaz, S. Jha, and A. Prakash · 2024
Closest in time.
Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024
M. Mazeika, L. Phan, X. Yin, A. Zou, Z. Wang, N. Mu, E. Sakhaee, N. Li, S. Basart, B. Li, D. Forsyth, and D. Hendrycks · 2024
Closest in time.
Gpt-4 technical report, 2024
OpenAI, J. Achiam, S. Adler, S. Agarwal, et al · 2024
Closest in time.
Tricking llms into disobedience: Formalizing, analyzing, and detecting jailbreaks, 2024
A. Rao, S. Vashistha, A. Naik, S. Aditya, and M. Choudhury · 2024
Closest in time.
Open problems in technical ai governance, 2024
A. Reuel, B. Bucknall, S. Casper, T. Fist, L. Soder, O. Aarne, L. Hammond, L. Ibrahim, A. Chan, P. Wills, M. Anderljung, B. Garfinkel, L. Heim, A. Trask, G. Mukobi, R. Schaeffer, M. Baker, S. Hooker, I. Solaiman, A. S. Luccioni, N. Rajkumar, N. Moës, J. Ladish, N. Guha, J. Newman, Y. Bengio, T. South, A. Pentland, S. Koyejo, M. J. Kochenderfer, and R. Trager · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
C. Anil, E. Durmus, M. Sharma, J. Benton, S. Kundu, J. Batson, N. Rimsky, M. Tong, J. Mu, D. Ford, et al · 2024
Cited alongside, same era.
Introducing the next generation of claude, 2024
Anthropic · 2024
Cited alongside, same era.
Do you need help making a bomb? safety-finetuned llms have you covered, April 2024
S. Casper · 2024
Cited alongside, same era.
Jailbreakbench: An open robustness benchmark for jailbreaking large language models, 2024
P. Chao, E. Debenedetti, A. Robey, M. Andriushchenko, F. Croce, V. Sehwag, E. Dobriban, N. Flammarion, G. J. Pappas, F. Tramer, H. Hassani, and E. Wong · 2024
Cited alongside, same era.
Struq: Defending against prompt injection with structured queries, 2024
S. Chen, J. Piet, C. Sitawarin, and D. Wagner · 2024
Cited alongside, same era.
Coercing llms to do and reveal (almost) anything, 2024
J. Geiping, A. Stein, M. Shu, K. Saifullah, Y. Wen, and T. Goldstein · 2024
Cited alongside, same era.
Defending against indirect prompt injection attacks with spotlighting, 2024
K. Hines, G. Lopez, M. Hall, F. Zarfati, Y. Zunger, and E. Kiciman · 2024
Cited alongside, same era.
Closest in time.
When do universal image jailbreaks transfer between vision-language models?, 2024
R. Schaeffer, D. Valentine, L. Bailey, J. Chua, C. Eyzaguirre, Z. Durante, J. Benton, B. Miranda, H. Sleight, J. Hughes, R. Agrawal, M. Sharma, S. Emmons, S. Koyejo, and E. Perez · 2024
Closest in time.
S. Schulhoff, J. Pinto, A. Khan, L.-F. Bouchard, C. Si, S. Anati, V. Tagliabue, A. L. Kost, C. Carnahan, and J. Boyd-Graber · 2024
Closest in time.
A strongreject for empty jailbreaks, 2024
A. Souly, Q. Lu, D. Bowen, T. Trinh, E. Hsieh, S. Pandey, P. Abbeel, J. Svegliato, S. Emmons, O. Watkins, and S. Toyer · 2024
Closest in time.
Meta llama guard 2
L. Team · 2024
Closest in time.
Factor of safety — Wikipedia, the free encyclopedia, 2024
Wikipedia contributors · 2024
Closest in time.
Prompt injection and jailbreaking are not the same thing, 2024
S. Willison · 2024
Closest in time.
Y. Zeng, H. Lin, J. Zhang, D. Yang, R. Jia, and W. Shi · 2024
Closest in time.
K. Zhu, J. Wang, J. Zhou, Z. Wang, H. Chen, Y. Wang, L. Yang, W. Ye, Y. Zhang, N. Z. Gong, and X. Xie · 2024
Closest in time.