Large language models can be used to effectively scale spear phishing campaigns
Original
Julian Hazell. 2023 · 2023
Cited alongside, same era.
Tree of attacks: Jailbreaking black-box llms automatically
Original
Anay Mehrotra, Manolis Zampetakis, Paul Kassianik, Blaine Nelson, Hyrum Anderson, Yaron Singer, and Amin Karbasi. 2023 · 2023
Cited alongside, same era.
The refinedweb dataset for falcon LLM: outperforming curated corpora with web data, and web data only
Original
Guilherme Penedo, Quentin Malartic, Daniel Hesslow, Ruxandra Cojocaru, Alessandro Cappelli, Hamza Alobeidli, Baptiste Pannier, Ebtesam Almazrouei, and Julien Launay. 2023 · 2023
Cited alongside, same era.
Smoothllm: Defending large language models against jailbreaking attacks
Original
Alexander Robey, Eric Wong, Hamed Hassani, and George J. Pappas. 2023 · 2023
Cited alongside, same era.
Llama 2: Open foundation and fine-tuned chat models
Original
Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al. 2023 · 2023
Cited alongside, same era.
Jailbroken: How does LLM safety training fail?
Original
Alexander Wei, Nika Haghtalab, and Jacob Steinhardt. 2023 · 2023
Cited alongside, same era.
GPTFUZZER: red teaming large language models with auto-generated jailbreak prompts
Original
Jiahao Yu, Xingwei Lin, Zheng Yu, and Xinyu Xing. 2023 · 2023
Cited alongside, same era.
Evaluating chatgpt’s information extraction capabilities: An assessment of performance, explainability, calibration, and faithfulness
Original
Bo Li, Gexiang Fang, Yang Yang, Quansen Wang, Wei Ye, Wen Zhao, and Shikun Zhang. 2023a
Cited in the paper.
Deepinception: Hypnotize large language model to be jailbreaker
Original
Xuan Li, Zhanke Zhou, Jianing Zhu, Jiangchao Yao, Tongliang Liu, and Bo Han. 2023b
Cited in the paper.
Prompt injection attack against llm-integrated applications
Original
Yi Liu, Gelei Deng, Yuekang Li, Kailong Wang, Tianwei Zhang, Yepang Liu, Haoyu Wang, Yan Zheng, and Yang Liu. 2023a
Cited in the paper.
Jailbreaking chatgpt via prompt engineering: An empirical study
Original
Yi Liu, Gelei Deng, Zhengzi Xu, Yuekang Li, Yaowen Zheng, Ying Zhang, Lida Zhao, Tianwei Zhang, and Yang Liu. 2023b
Cited in the paper.
Software testing with large language model: Survey, landscape, and vision
Original
Junjie Wang, Yuchao Huang, Chunyang Chen, Zhe Liu, Song Wang, and Qing Wang. 2023a
Cited in the paper.