Fetching the paper…
Reading the bibliography…
The recent breakthrough in large language models (LLMs) such as ChatGPT has revolutionized production processes at an unprecedented pace.
Deep reinforcement learning from human preferences
P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei · 2017
Earlier work this paper cites.
Defending against alignment-breaking attacks via robustly aligned llm, 2023
B. Cao, Y. Cao, L. Lin, and J. Chen · 2023
Earlier work this paper cites.
Jailbreaking black box large language models in twenty queries, 2023
P. Chao, A. Robey, E. Dobriban, H. Hassani, G. J. Pappas, and E. Wong · 2023
Earlier work this paper cites.
Chat gpt "dan" (and other "jailbreaks"), 2023
DAN · 2023
Earlier work this paper cites.
A survey of large language models for healthcare: from data, technology, and applications to accountability and ethics, 2023
K. He, R. Mao, Q. Lin, Y. Ruan, X. Lan, M. Feng, and E. Cambria · 2023
Earlier work this paper cites.
Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023
H. Inan, K. Upasani, J. Chi, R. Rungta, K. Iyer, Y. Mao, M. Tontchev, Q. Hu, B. Fuller, D. Testuggine, and M. Khabsa · 2023
Earlier work this paper cites.
Beavertails: Towards improved safety alignment of LLM via a human-preference dataset
J. Ji, M. Liu, J. Dai, X. Pan, C. Zhang, C. Bian, B. Chen, R. Sun, Y. Wang, and Y. Yang · 2023
Earlier work this paper cites.
Large language models in law: A survey, 2023
J. Lai, W. Gan, J. Wu, Z. Qi, and P. S. Yu · 2023
Earlier work this paper cites.
Large language models in finance: A survey
Y. Li, S. Wang, H. Ding, and H. Chen · 2023
Earlier work this paper cites.
Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2023
X. Liu, N. Xu, M. Chen, and C. Xiao · 2023
Earlier work this paper cites.
Tree of attacks: Jailbreaking black-box llms automatically, 2023
A. Mehrotra, M. Zampetakis, P. Kassianik, B. Nelson, H. Anderson, Y. Singer, and A. Karbasi · 2023
Earlier work this paper cites.
The imperative for regulatory oversight of large language models (or generative ai) in healthcare
B. Mesk and E. J. Topol · 2023
Cited alongside, same era.
Direct preference optimization: Your language model is secretly a reward model
R. Rafailov, A. Sharma, E. Mitchell, C. D. Manning, S. Ermon, and C. Finn · 2023
Cited alongside, same era.
Smoothllm: Defending large language models against jailbreaking attacks, 2023
A. Robey, E. Wong, H. Hassani, and G. J. Pappas · 2023
Cited alongside, same era.
Sharegpt90k, Apr 2023
RyokoAI · 2023
Cited alongside, same era.
Large language models for automated q&a involving legal documents: a survey on algorithms, frameworks and applications
X. Yang, Z. Wang, Q. Wang, K. Wei, K. Zhang, and J. Shi · 2023
Cited alongside, same era.
Many-shot jailbreaking, 2024
C. Anil, E. Durmus, M. Sharma, J. Benton, S. Kundu, J. Batson, and D. Duvenaud · 2024
Closest in time.
The claude 3 model family: Opus, sonnet, haiku, Mar 2024
Anthropic · 2024
Closest in time.
Play guessing game with llm: Indirect jailbreak attack with implicit clues
Z. Chang, M. Li, Y. Liu, J. Wang, Q. Wang, and Y. Liu · 2024
Closest in time.
Safe rlhf: Safe reinforcement learning from human feedback
J. Dai, X. Pan, R. Sun, J. Ji, X. Xu, M. Liu, Y. Wang, and Y. Yang · 2024
Closest in time.
Jailbreaking proprietary large language models using word substitution cipher, 2024
D. Handa, A. Chirmule, B. Gajera, and C. Baral · 2024
Closest in time.
Artprompt: Ascii art-based jailbreak attacks against aligned llms, 2024
F. Jiang, Z. Xu, L. Niu, Z. Xiang, B. Ramasubramanian, B. Li, and R. Poovendran · 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
H. Zhang, Z. Guo, H. Zhu, B. Cao, L. Lin, J. Jia, J. Chen, and D. Wu · 2023
Cited alongside, same era.
LIMA: Less is more for alignment
C. Zhou, P. Liu, P. Xu, S. Iyer, J. Sun, Y. Mao, X. Ma, A. Efrat, P. Yu, L. YU, S. Zhang, G. Ghosh, M. Lewis, L. Zettlemoyer, and O. Levy · 2023
Cited alongside, same era.
AutoDAN: Automatic and interpretable adversarial attacks on large language models
S. Zhu, R. Zhang, B. An, G. Wu, J. Barrow, Z. Wang, F. Huang, A. Nenkova, and T. Sun · 2023
Cited alongside, same era.
Universal and transferable adversarial attacks on aligned language models, 2023
A. Zou, Z. Wang, J. Z. Kolter, and M. Fredrikson · 2023
Cited alongside, same era.
Jailbreaking leading safety-aligned llms with simple adaptive attacks, 2024
M. Andriushchenko, F. Croce, and N. Flammarion · 2024
Cited alongside, same era.
Training a helpful and harmless assistant with reinforcement learning from human feedback
Y. Bai, A. Jones, K. Ndousse, A. Askell, A. Chen, N. DasSarma, D. Drain, S. Fort, D. Ganguli, T. Henighan, N. Joseph, S. Kadavath, J. Kernion, T. Conerly, S. El-Showk, N. Elhage, Z. Hatfield-Dodds, D. Hernandez, T. Hume, S. Johnston, S. Kravec, L. Lovitt, N. Nanda, C. Olsson, D. Amodei, T. B. Brown, J. Clark, S. McCandlish, C. Olah, B. Mann, and J. Kaplan
Cited in the paper.
Constitutional ai: Harmlessness from ai feedback
Y. Bai, S. Kadavath, S. Kundu, A. Askell, J. Kernion, A. Jones, A. Chen, A. Goldie, A. Mirhoseini, C. McKinnon, C. Chen, C. Olsson, C. Olah, D. Hernandez, D. Drain, D. Ganguli, D. Li, E. Tran-Johnson, E. Perez, J. Kerr, J. Mueller, J. Ladish, J. Landau, K. Ndousse, K. Lukošiūtė, L. Lovitt, M. Sellitto, N. Elhage, N. Schiefer, N. Mercado, N. DasSarma, R. Lasenby, R. Larson, S. Ringer, S. Johnston, S. Kravec, S. E. Showk, S. Fort, T. Lanham, T. Telleen-Lawton, T. Conerly, T. Henighan, T. Hume, S. Bowman, Z. Hatfield-Dodds, B. Mann, D. Amodei, N. Joseph, S. McCandlish, T. B. Brown, and J. Kaplan
Cited in the paper.
Closest in time.
Drattack: Prompt decomposition and reconstruction makes powerful llm jailbreakers, 2024
X. Li, R. Wang, M. Cheng, T. Zhou, and C.-J. Hsieh · 2024
Closest in time.
Generative ai and large language models in health care: pathways to implementation
M. M. Raza, K. P. Venkatesh, and J. C. Kvedar · 2024
Closest in time.
How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms, 2024
Y. Zeng, H. Lin, J. Zhang, D. Yang, R. Jia, and W. Shi · 2024
Closest in time.
Revolutionizing finance with llms: An overview of applications and insights, 2024
H. Zhao, Z. Liu, Z. Wu, Y. Li, T. Yang, P. Shu, S. Xu, H. Dai, L. Zhao, G. Mai, N. Liu, and T. Liu · 2024
Closest in time.