Fetching the paper…
Reading the bibliography…
Current LLM alignment methods are readily broken through specifically crafted adversarial prompts.
Universal Adversarial Triggers for Attacking and Analyzing NLP
Wallace, E., Feng, S., Kandpal, N., Gardner, M., and Singh, S · 1908
Earlier work this paper cites.
Possible generalization of Boltzmann-Gibbs statistics
Tsallis, C · 1988
Earlier work this paper cites.
Efficient projections onto the l
Duchi, J., Shalev-Shwartz, S., Singer, Y., and Chandra, T · 2008
Earlier work this paper cites.
Adversarial Examples on Object Recognition: A Comprehensive Survey, September 2020
Serban, A., Poll, E., and Visser, J · 2008
Earlier work this paper cites.
AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts
Shin, T., Razeghi, Y., Logan IV, R. L., Wallace, E., and Singh, S · 2010
Earlier work this paper cites.
Intriguing properties of neural networks
Szegedy, C., Zaremba, W., Sutskever, I., Bruna, J., Erhan, D., Goodfellow, I. J., and Fergus, R · 2014
Earlier work this paper cites.
Adam: A Method for Stochastic Optimization
Kingma, D. P. and Ba, J · 2015
Earlier work this paper cites.
Categorical Reparameterization with Gumbel-Softmax
Jang, E., Gu, S., and Poole, B · 2016
Earlier work this paper cites.
SGDR: Stochastic gradient descent with warm restarts
Loshchilov, I. and Hutter, F · 2017
Earlier work this paper cites.
Towards deep learning models resistant to adversarial attacks
Madry, A., Makelov, A., Schmidt, L., Tsipras, D., and Vladu, A · 2018
Earlier work this paper cites.
Topology attack and defense for graph neural networks: An optimization perspective
Xu, K., Chen, H., Liu, S., Chen, P. Y., Weng, T. W., Hong, M., and Lin, X · 2019
Earlier work this paper cites.
On Adaptive Attacks to Adversarial Example Defenses
Tramer, F., Carlini, N., Brendel, W., and Madry, A · 2020
Earlier work this paper cites.
Robustness of Graph Neural Networks at Scale
Geisler, S., Schmidt, T., Şirin, H., Zügner, D., Bojchevski, A., and Günnemann, S · 2021
Cited alongside, same era.
Gradient-based Adversarial Attacks against Text Transformers
Guo, C., Sablayrolles, A., Jégou, H., and Kiela, D · 2021
Cited alongside, same era.
Adversarial Robustness for Machine Learning
Chen, P.-Y. and Hsieh, C.-J · 2022
Cited alongside, same era.
Generalization of Neural Combinatorial Solvers Through the Lens of Adversarial Robustness
Geisler, S., Sommer, J., Schuchardt, J., Bojchevski, A., and Günnemann, S · 2022
Cited alongside, same era.
Gradient-based Constrained Sampling from Language Models
Kumar, S., Paria, B., and Tsvetkov, Y · 2022
Cited alongside, same era.
Adversarial Attacks and Defenses in Large Language Models: Old and New Threats, October 2023
Schwinn, L., Dobre, D., Günnemann, S., and Gidel, G · 2023
Later among the works it cites.
Llama 2: Open Foundation and Fine-Tuned Chat Models, July 2023
Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., Bikel, D., Blecher, L., Ferrer, C. C., Chen, M., Cucurull, G., Esiobu, D., Fernandes, J., Fu, J., Fu, W., Fuller, B., Gao, C., Goswami, V., Goyal, N., Hartshorn, A., Hosseini, S., Hou, R., Inan, H., Kardas, M., Kerkez, V., Khabsa, M., Kloumann, I., Korenev, A., Koura, P. S., Lachaux, M.-A., Lavril, T., Lee, J., Liskovich, D., Lu, Y., Mao, Y., Martinet, X., Mihaylov, T., Mishra, P., Molybog, I., Nie, Y., Poulton, A., Reizenstein, J., Rungta, R., Saladi, K., Schelten, A., Silva, R., Smith, E. M., Subramanian, R., Tan, X. E., Tang, B., Taylor, R., Williams, A., Kuan, J. X., Xu, P., Yan, Z., Zarov, I., Zhang, Y., Fan, A., Kambadur, M., Narang, S., Rodriguez, A., Stojnic, R., Edunov, S., and Scialom, T · 2023
Later among the works it cites.
Hard Prompts Made Easy: Gradient-Based Discrete Optimization for Prompt Tuning and Discovery
Wen, Y., Jain, N., Kirchenbauer, J., Goldblum, M., Geiping, J., and Goldstein, T · 2023
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Perez, E., Huang, S., Song, F., Cai, T., Ring, R., Aslanides, J., Glaese, A., McAleese, N., and Irving, G · 2022
Cited alongside, same era.
The Falcon Series of Open Language Models, November 2023
Almazrouei, E., Alobeidli, H., Alshamsi, A., Cappelli, A., Cojocaru, R., Debbah, M., Goffinet, \., Hesslow, D., Launay, J., Malartic, Q., Mazzotta, D., Noune, B., Pannier, B., and Penedo, G · 2023
Cited alongside, same era.
Jailbreaking Black Box Large Language Models in Twenty Queries, October 2023
Chao, P., Robey, A., Dobriban, E., Hassani, H., Pappas, G. J., and Wong, E · 2023
Cited alongside, same era.
Adversarial Training for Graph Neural Networks: Pitfalls, Solutions, and New Directions
Gosch, L., Geisler, S., Sturm, D., Charpentier, B., Zügner, D., and Günnemann, S · 2023
Cited alongside, same era.
TextGrad: Advancing Robustness Evaluation in NLP by Gradient-Driven Optimization
Hou, B., Jia, J., Zhang, Y., Zhang, G., Zhang, Y., Liu, S., and Chang, S · 2023
Cited alongside, same era.
Open Sesame! Universal Black Box Jailbreaking of Large Language Models, November 2023
Lapid, R., Langberg, R., and Sipper, M · 2023
Cited alongside, same era.
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically, December 2023
Mehrotra, A., Zampetakis, M., Kassianik, P., Nelson, B., Anderson, H., Singer, Y., and Karbasi, A · 2023
Cited alongside, same era.
Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., and Stoica, I · 2023
Later among the works it cites.
AutoDAN: Automatic and Interpretable Adversarial Attacks on Large Language Models, October 2023
Zhu, S., Zhang, R., An, B., Wu, G., Barrow, J., Wang, Z., Huang, F., Nenkova, A., and Sun, T · 2023
Later among the works it cites.
Universal and Transferable Adversarial Attacks on Aligned Language Models, July 2023
Zou, A., Wang, Z., Carlini, N., Nasr, M., Kolter, J. Z., and Fredrikson, M · 2023
Later among the works it cites.
Gemma: Open Models Based on Gemini Research and Technology, April 2024
DeepMind, Mesnard, T., Hardin, C., Dadashi, R., Bhupatiraju, S., Pathak, S., Sifre, L., Rivière, M., Kale, M. S., Love, J., Tafti, P., Hussenot, L., Sessa, P. G., Chowdhery, A., Roberts, A., Barua, A., Botev, A., Castro-Ros, A., Slone, A., Héliou, A., Tacchetti, A., Bulanova, A., Paterson, A., Tsai, B., Shahriari, B., Lan, C. L., Choquette-Choo, C. A., Crepy, C., Cer, D., Ippolito, D., Reid, D., Buchatskaya, E., Ni, E., Noland, E., Yan, G., Tucker, G., Muraru, G.-C., Rozhdestvenskiy, G., Michalewski, H., Tenney, I., Grishchenko, I., Austin, J., Keeling, J., Labanowski, J., Lespiau, J.-B., Stanway, J., Brennan, J., Chen, J., Ferret, J., Chiu, J., Mao-Jones, J., Lee, K., Yu, K., Millican, K., Sjoesund, L. L., Lee, L., Dixon, L., Reid, M., Mikuła, M., Wirth, M., Sharman, M., Chinaev, N., Thain, N., Bachem, O., Chang, O., Wahltinez, O., Bailey, P., Michel, P., Yotov, P., Chaabouni, R., Comanescu, R., Jana, R., Anil, R., McIlroy, R., Liu, R., Mullins, R., Smith, S. L., Borgeaud, S., Girgin, S., Douglas, S., Pandya, S., Shakeri, S., De, S., Klimenko, T., Hennigan, T., Feinberg, V., Stokowiec, W., Chen, Y.-h., Ahmed, Z., Gong, Z., Warkentin, T., Peran, L., Giang, M., Farabet, C., Vinyals, O., Dean, J., Kavukcuoglu, K., Hassabis, D., Ghahramani, Z., Eck, D., Barral, J., Pereira, F., Collins, E., Joulin, A., Fiedel, N., Senter, E., Andreev, A., and Kenealy, K · 2024
Closest in time.
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
Liu, X., Xu, N., Chen, M., and Xiao, C · 2024
Closest in time.
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
Mazeika, M., Phan, L., Yin, X., Zou, A., Wang, Z., Mu, N., Sakhaee, E., Li, N., Basart, S., Li, B., Forsyth, D., and Hendrycks, D · 2024
Closest in time.
Gradient-Based Language Model Red Teaming, January 2024
Wichers, N., Denison, C., and Beirami, A · 2024
Closest in time.
Geisler, S., Wollschläger, T., Abdalla, M. H. I., Cohen-Addad, V., Gasteiger, J., and Günnemann, S · 2025
Closest in time.