Fetching the paper…
Reading the bibliography…
Research into AI alignment has grown considerably since the recent introduction of increasingly capable Large Language Models (LLMs).
Language models are few-shot learners
Tom Brown et al. 2020 · 1901
Earlier work this paper cites.
Harrison Bergeron
Kurt Vonnegut. 1968 · 1968
Earlier work this paper cites.
Recipes for building an open-domain chatbot
Roller Stephen et al. 2021 · 2021
Earlier work this paper cites.
Red teaming language models with language models
Ethan Perez et al. 2022 · 2022
Earlier work this paper cites.
Moral foundations of large language models
Marwa Abdulhai, Cl´ement Crepy, Daria Valter, John Canny, and Natasha Jaques. 2023 · 2023
Earlier work this paper cites.
Jailbreak chat
Alex Albert. 2023 · 2023
Earlier work this paper cites.
Aibek Bekbayev, Sungbae Chun, Yerzat Dulat, and James Yamazaki. 2023 · 2023
Earlier work this paper cites.
Open problems and fundamental limitations of reinforcement learning from human feedback
Stephen Casper et al. 2023 · 2023
Earlier work this paper cites.
Common crawl
Gil Elbaz et al. 2023 · 2023
Earlier work this paper cites.
Albert Q. Jiang et al. 2023 · 2023
Earlier work this paper cites.
Certifying llm safety against adversarial prompting
Aounon Kumar, Chirag Agarwal, Suraj Srinivas, Soheil Feizi, and Hima Lakkaraju. 2023 · 2023
Earlier work this paper cites.
Self-refine: Iterative refinement with self-feedback
Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Bodhisattwa Prasad Majumder, Katherine Hermann, Sean Welleck, Amir Yazdanbakhsh, and Peter Clark. 2023 · 2023
Cited alongside, same era.
Chat gpt "dan" (and other "jailbreaks")
AJ ONeal. 2023 · 2023
Cited alongside, same era.
Llm self defense: By self examination, llms know they are being tricked
Mansi Phute et al. 2023 · 2023
Cited alongside, same era.
Smoothllm: Defending large language models against jailbreaking attacks
Alexander Robey, Eric Wong, Hamed Hassani, and George J. Pappas. 2023 · 2023
Cited alongside, same era.
French ai darling mistral’s new llm can teach bomb building — researchers say that’s a problem
Tim Smith. 2023 · 2023
Cited alongside, same era.
Jailbreaking black box large language models in twenty queries
Patrick Chao, Alexander Robey, Edgar Dobriban, Hamed Hassani, George J. Pappas, and Eric Wong. 2024 · 2024
Closest in time.
Masterkey: Automated jailbreak across multiple large language model chatbots
Gelei Deng et al. 2023 · 2024
Closest in time.
Multilingual jailbreak challenges in large language models
Yue Deng, Wenxuan Zhang, Sinno Jialin Pan, and Lidong Bing. 2024 · 2024
Closest in time.
Catastrophic jailbreak of open-source llms via exploiting generation
Yangsibo Huang, Samyak Gupta, Mengzhou Xia, Kai Li, and Danqi Chen. 2024 · 2024
Closest in time.
OpenAI et al. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Llama 2: Open foundation and fine-tuned chat models
Hugo Touvron et al. 2023 · 2023
Cited alongside, same era.
Jailbroken: How does llm safety training fail?
Alexander Wei, Nika Haghtalab, and Jacob Steinhardt. 2023 · 2023
Cited alongside, same era.
A prompt pattern catalog to enhance prompt engineering with chatgpt
Jules White et al. 2023 · 2023
Cited alongside, same era.
Fundamental limitations of alignment in large language models
Yotam Wolf, Noam Wies, Oshri Avnery, Yoav Levine, and Amnon Shashua. 2023 · 2023
Cited alongside, same era.
Expertprompting: Instructing large language models to be distinguished experts
Benfeng Xu, An Yang, Junyang Lin, Quan Wang, Chang Zhou, Yongdong Zhang, and Zhendong Mao. 2023 · 2023
Cited alongside, same era.
Universal and transferable adversarial attacks on aligned language models
Andy Zou, Zifan Wang, J. Zico Kolter, and Matt Fredrikson. 2023 · 2023
Cited alongside, same era.
Autodan: Generating stealthy jailbreak prompts on aligned large language models
Xiaogeng Liu, Nan Xu, Muhao Chen, and Chaowei Xiao. 2023a
Cited in the paper.
Fine-tuning aligned language models compromises safety, even when users do not intend to!
Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, and Peter Henderson. 2024 · 2024
Closest in time.
Google bard avoids queries that mention israel or palestine
Arif Rafiq. 2024 · 2024
Closest in time.
Gemini image generation got it wrong. we’ll do better
Prabhakar Raghavan. 2024 · 2024
Closest in time.
Google explains gemini’s ‘embarrassing’ ai pictures of diverse nazis
Emma Roth. 2024 · 2024
Closest in time.
Measuring massive multitask language understanding
Dan Hendrycks et al. 2021 · 2049
Closest in time.