Fetching the paper…
Reading the bibliography…
LLM developers have imposed technical interventions to prevent fine-tuning misuse attacks, attacks where adversaries evade safeguards by fine-tuning the model using a public API.
Principles and practice of information theory
Richard E. Blahut · 1987
Earlier work this paper cites.
Targeted backdoor attacks on deep learning systems using data poisoning, 2017
Xinyun Chen, Chang Liu, Bo Li, Kimberly Lu, and Dawn Song · 2017
Earlier work this paper cites.
Commonsenseqa: A question answering challenge targeting commonsense knowledge, 2019
Alon Talmor, Jonathan Herzig, Nicholas Lourie, and Jonathan Berant · 2019
Earlier work this paper cites.
Low-stakes alignment
Paul Christiano · 2021
Earlier work this paper cites.
Auditing failures vs concentrated failures
Ryan Greenblatt and Fabien Roger · 2023
Earlier work this paper cites.
Measuring faithfulness in chain-of-thought reasoning, 2023
Tamera Lanham, Anna Chen, Ansh Radhakrishnan, Benoit Steiner, Carson Denison, Danny Hernandez, Dustin Li, Esin Durmus, Evan Hubinger, Jackson Kernion, Kamilė Lukošiūtė, Karina Nguyen, Newton Cheng, Nicholas Joseph, Nicholas Schiefer, Oliver Rausch, Robin Larson, Sam McCandlish, Sandipan Kundu, Saurav Kadavath, Shannon Yang, Thomas Henighan, Timothy Maxwell, Timothy Telleen-Lawton, Tristan Hume, Zac Hatfield-Dodds, Jared Kaplan, Jan Brauner, Samuel R. Bowman, and Ethan Perez · 2023
Earlier work this paper cites.
Instruction tuning with gpt-4, 2023
Baolin Peng, Chunyuan Li, Pengcheng He, Michel Galley, and Jianfeng Gao · 2023
Earlier work this paper cites.
Fine-tuning aligned language models compromises safety, even when users do not intend to!, 2023
Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, and Peter Henderson · 2023
Earlier work this paper cites.
Gpqa: A graduate-level google-proof q&a benchmark, 2023
David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R. Bowman · 2023
Earlier work this paper cites.
Look before you leap: A universal emergent decomposition of retrieval tasks in language models, 2023
Alexandre Variengien and Eric Winsor · 2023
Earlier work this paper cites.
Usage policy, June 2024
Anthropic · 2024
Earlier work this paper cites.
Sabotage evaluations for frontier models, 2024
Joe Benton, Misha Wagner, Eric Christiansen, Cem Anil, Ethan Perez, Jai Srivastav, Esin Durmus, Deep Ganguli, Shauna Kravec, Buck Shlegeris, Jared Kaplan, Holden Karnofsky, Evan Hubinger, Roger Grosse, Samuel R. Bowman, and David Duvenaud · 2024
Earlier work this paper cites.
Hopping too late: Exploring the limitations of large language models on multi-hop queries, 2024
Eden Biran, Daniela Gottesman, Sohee Yang, Mor Geva, and Amir Globerson · 2024
Earlier work this paper cites.
Poisoning web-scale training datasets is practical, 2024
Nicholas Carlini, Matthew Jagielski, Christopher A. Choquette-Choo, Daniel Paleka, Will Pearce, Hyrum Anderson, Andreas Terzis, Kurt Thomas, and Florian Tramèr · 2024
Earlier work this paper cites.
Or-bench: An over-refusal benchmark for large language models, 2024
Justin Cui, Wei-Lin Chiang, Ion Stoica, and Cho-Jui Hsieh · 2024
Earlier work this paper cites.
Fine-tuning with the gemini api
Google · 2024
Cited alongside, same era.
Generative ai-prohibited use policy
Google · 2024
Cited alongside, same era.
Covert malicious finetuning: Challenges in safeguarding llm adaptation, 2024
Danny Halawi, Alexander Wei, Eric Wallace, Tony T. Wang, Nika Haghtalab, and Jacob Steinhardt · 2024
Cited alongside, same era.
WildGuard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of LLMs, 2024
Seungju Han, Kavel Rao, Allyson Ettinger, Liwei Jiang, Bill Yuchen Lin, Nathan Lambert, Yejin Choi, and Nouha Dziri · 2024
Cited alongside, same era.
What is in your safe data? identifying benign data that breaks safety, 2024
Luxi He, Mengzhou Xia, and Peter Henderson · 2024
Cited alongside, same era.
Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment, 2024
Jiongxiao Wang, Jiazhao Li, Yiquan Li, Xiangyu Qi, Junjie Hu, Yixuan Li, Patrick McDaniel, Muhao Chen, Bo Li, and Chaowei Xiao · 2024
Later among the works it cites.
Measuring short-form factuality in large language models, 2024
Jason Wei, Nguyen Karina, Hyung Won Chung, Yunxin Joy Jiao, Spencer Papay, Amelia Glaese, John Schulman, and William Fedus · 2024
Later among the works it cites.
Adaptive deployment of untrusted llms reduces distributed threats, 2024
Jiaxin Wen, Vivek Hebbar, Caleb Larson, Aryan Bhatt, Ansh Radhakrishnan, Mrinank Sharma, Henry Sleight, Shi Feng, He He, Ethan Perez, Buck Shlegeris, and Akbir Khan · 2024
Later among the works it cites.
Finetunebench: How well do commercial fine-tuning apis infuse knowledge into llms?, 2024
Eric Wu, Kevin Wu, and James Zou · 2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Tiansheng Huang, Sihao Hu, and Ling Liu · 2024
Cited alongside, same era.
Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks, 2024
Samyak Jain, Robert Kirk, Ekdeep Singh Lubana, Robert P. Dick, Hidenori Tanaka, Edward Grefenstette, Tim Rocktäschel, and David Scott Krueger · 2024
Cited alongside, same era.
The wmdp benchmark: Measuring and reducing malicious use with unlearning, 2024
Nathaniel Li, Alexander Pan, Anjali Gopal, Summer Yue, Daniel Berrios, Alice Gatti, Justin D. Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm-Burger, Rassin Lababidi, Lennart Justen, Andrew B. Liu, Michael Chen, Isabelle Barrass, Oliver Zhang, Xiaoyuan Zhu, Rishub Tamirisa, Bhrugu Bharathi, Adam Khoja, Zhenqi Zhao, Ariel Herbert-Voss, Cort B. Breuer, Samuel Marks, Oam Patel, Andy Zou, Mantas Mazeika, Zifan Wang, Palash Oswal, Weiran Lin, Adam A. Hunt, Justin Tienken-Harder, Kevin Y. Shih, Kemper Talley, John Guan, Russell Kaplan, Ian Steneker, David Campbell, Brad Jokubaitis, Alex Levinson, Jean Wang, William Qian, Kallol Krishna Karmakar, Steven Basart, Stephen Fitz, Mindy Levine, Ponnurangam Kumaraguru, Uday Tupakula, Vijay Varadharajan, Ruoyu Wang, Yan Shoshitaishvili, Jimmy Ba, Kevin M. Esvelt, Alexandr Wang, and Dan Hendrycks · 2024
Cited alongside, same era.
Llama guard 3 documentation, 2024
Meta AI · 2024
Cited alongside, same era.
Secret collusion among generative ai agents, 2024
Sumeet Ramesh Motwani, Mikhail Baranchuk, Martin Strohmeier, Vijay Bolina, Philip H. S. Torr, Lewis Hammond, and Christian Schroeder de Witt · 2024
Cited alongside, same era.
Usage policies
OpenAI · 2024
Cited alongside, same era.
Exploiting novel gpt-4 apis, 2024
Kellin Pelrine, Mohammad Taufeeque, Michał Zając, Euan McLean, and Adam Gleave · 2024
Cited alongside, same era.
Removing rlhf protections in gpt-4 via fine-tuning, 2024
Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta, Tatsunori Hashimoto, and Daniel Kang · 2024
Later among the works it cites.
Benchmarking misuse mitigation against covert adversaries, 2025
Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, and Hamed Hassani · 2025
Closest in time.
Customize a model with fine-tuning: Safety evaluation gpt-4, gpt-4o, and gpt-4o-mini fine-tuning - public preview
Michael Bullwinkle, Eric Urban, Alex Kasavin, Aaron Hill, and Nitin Mehrotra · 2025
Closest in time.
Content filtering, 2024
Patrick Farley, Sheri Gilley, Eric Urban, Alma Jenks, Michael Bullwinkle, Manohar Lakkoju, Challen Parker, Delora Bradish, and Michael Greene · 2025
Closest in time.
Deliberative alignment: Reasoning enables safer language models, 2025
Melody Y. Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Helyar, Rachel Dias, Andrea Vallone, Hongyu Ren, Jason Wei, Hyung Won Chung, Sam Toyer, Johannes Heidecke, Alex Beutel, and Amelia Glaese · 2025
Closest in time.
OpenAI model specification - may 8, 2024
OpenAI · 2025
Closest in time.
Fine-tuning, 2025
OpenAI · 2025
Closest in time.
Managing Misuse Risk for Dual-Use Foundation Models
U.S. AI Safety Institute · 2025
Closest in time.
Adversarial machine learning: A taxonomy and terminology of attacks and mitigations
Apostol Vassilev, Alina Oprea, Alie Fordyce, Hyrum Anderson, Xander Davies, and Maia Hamin · 2025
Closest in time.
Fine-tune anthropic’s claude 3 haiku in amazon bedrock to boost model accuracy and quality, July 10 2024
Yanyan Zhang, Fang Liu, Sovik Nath, and Carrie Wu · 2025
Closest in time.