Fetching the paper…
Reading the bibliography…
LLM agents have the potential to revolutionize defensive cyber operations, but their offensive capabilities are not yet fully understood.
The threats to our products, microsoft interface
Kohnfelder, L. and Praerit, G · 1999
Earlier work this paper cites.
The Diamond Model of Intrusion Analysis
Caltagirone, S., Pendergast, A., and Betz, C · 2013
Earlier work this paper cites.
Ukraine cyber-induced power outage: Analysis and practical mitigation strategies
Whitehead, D. E., Owens, K., Gammel, D., and Smith, J · 2017
Earlier work this paper cites.
Executive Summary - China: The Risk to Corporate America, 2019
FBI · 2019
Earlier work this paper cites.
MITRE ATT&CK: Design and Philosophy
MITRE · 2020
Earlier work this paper cites.
OWASP Risk Rating Methodology, March 2020
Williams, J · 2020
Earlier work this paper cites.
Discovering Language Model Behaviors with Model-Written Evaluations, December 2022
Perez, E., Ringer, S., Lukošiūtė, K., Nguyen, K., Chen, E., Heiner, S., Pettit, C., Olsson, C., Kundu, S., Kadavath, S., Jones, A., Chen, A., Mann, B., Israel, B., Seethor, B., McKinnon, C., Olah, C., Yan, D., Amodei, D., Amodei, D., Drain, D., Li, D., Tran-Johnson, E., Khundadze, G., Kernion, J., Landis, J., Kerr, J., Mueller, J., Hyun, J., Landau, J., Ndousse, K., Goldberg, L., Lovitt, L., Lucas, M., Sellitto, M., Zhang, M., Kingsland, N., Elhage, N., Joseph, N., Mercado, N., DasSarma, N., Rausch, O., Larson, R., McCandlish, S., Johnston, S., Kravec, S., Showk, S. E., Lanham, T., Telleen-Lawton, T., Brown, T., Henighan, T., Hume, T., Bai, Y., Hatfield-Dodds, Z., Clark, J., Bowman, S. R., Askell, A., Grosse, R., Hernandez, D., Ganguli, D., Hubinger, E., Schiefer, N., and Kaplan, J · 2022
Earlier work this paper cites.
Anderljung, M., Smith, E. T., O’Brien, J., Soder, L., Bucknall, B., Bluemke, E., Schuett, J., Trager, R., Strahm, L., and Chowdhury, R · 2023
Earlier work this paper cites.
Anthropic’s Responsible Scaling Policy, Version 1.0
Anthropic · 2023
Earlier work this paper cites.
EU AI Act: first regulation on artificial intelligence, August 2023
EU · 2023
Earlier work this paper cites.
Global Cybersecurity Outlook 2023
Forum, W. E · 2023
Earlier work this paper cites.
Self-exfiltration is a key dangerous capability, September 2023
Leike, J · 2023
Earlier work this paper cites.
openai-preparedness-framework-beta.pdf
OpenAI · 2023
Earlier work this paper cites.
An Attacker’s Dream? Exploring the Capabilities of ChatGPT for Developing Malware
Pa Pa, Y. M., Tanizaki, S., Kou, T., van Eeten, M., Yoshioka, K., and Matsumoto, T · 2023
Earlier work this paper cites.
Pan, A., Chan, J. S., Zou, A., Li, N., Basart, S., Woodside, T., Ng, J., Zhang, H., Emmons, S., and Hendrycks, D · 2023
Earlier work this paper cites.
AI Deception: A Survey of Examples, Risks, and Potential Solutions, August 2023
Park, P. S., Goldstein, S., O’Gara, A., Chen, M., and Hendrycks, D · 2023
Earlier work this paper cites.
Intercode: Standardizing and benchmarking interactive coding with execution feedback, 2023
Yang, J., Prabhakar, A., Narasimhan, K., and Yao, S · 2023
Cited alongside, same era.
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models, April 2024
Bhatt, M., Chennabasappa, S., Li, Y., Nikolaidis, C., Song, D., Wan, S., Ahmad, F., Aschermann, C., Chen, Y., Kapil, D., Molnar, D., Whitman, S., and Saxe, J · 2024
Cited alongside, same era.
Pirates without Borders: The Propagation of Cyberattacks through Firms’ Supply Chains
Crosignani, M., Macchiavelli, M., and Silva, A. F · 2024
Cited alongside, same era.
OR-Bench: An Over-Refusal Benchmark for Large Language Models, June 2024
Cui, J., Chiang, W.-L., Stoica, I., and Hsieh, C.-J · 2024
Cited alongside, same era.
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model, June 2024
The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning, May 2024
Li, N., Pan, A., Gopal, A., Yue, S., Berrios, D., Gatti, A., Li, J. D., Dombrowski, A.-K., Goel, S., Phan, L., Mukobi, G., Helm-Burger, N., Lababidi, R., Justen, L., Liu, A. B., Chen, M., Barrass, I., Zhang, O., Zhu, X., Tamirisa, R., Bharathi, B., Khoja, A., Zhao, Z., Herbert-Voss, A., Breuer, C. B., Marks, S., Patel, O., Zou, A., Mazeika, M., Wang, Z., Oswal, P., Lin, W., Hunt, A. A., Tienken-Harder, J., Shih, K. Y., Talley, K., Guan, J., Kaplan, R., Steneker, I., Campbell, D., Jokubaitis, B., Levinson, A., Wang, J., Qian, W., Karmakar, K. K., Basart, S., Fitz, S., Levine, M., Kumaraguru, P., Tupakula, U., Varadharajan, V., Wang, R., Shoshitaishvili, Y., Ba, J., Esvelt, K. M., Wang, A., and Hendrycks, D · 2024
Closest in time.
Cyber kill chain, 2024
Lockheed Martin · 2024
Closest in time.
The llama 3 herd of models, 2024
Meta · 2024
Closest in time.
Levels of AGI for Operationalizing Progress on the Path to AGI, June 2024
Morris, M. R., Sohl-dickstein, J., Fiedel, N., Warkentin, T., Dafoe, A., Faust, A., Farabet, C., and Legg, S · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
DeepSeek-AI · 2024
Cited alongside, same era.
AI Safety Institute approach to evaluations, February 2024
DSIT · 2024
Cited alongside, same era.
Key trends and figures in machine learning, 2023
Epoch AI · 2024
Cited alongside, same era.
LLM Agents can Autonomously Hack Websites, February 2024
Fang, R., Bindu, R., Gupta, A., Zhan, Q., and Kang, D · 2024
Cited alongside, same era.
Thousands of AI Authors on the Future of AI, April 2024
Grace, K., Stewart, H., Sandkühler, J. F., Thomas, S., Weinstein-Raun, B., and Brauner, J · 2024
Cited alongside, same era.
Benchmark inflation: Revealing llm performance gaps using retro-holdouts, 2024
Haimes, J., Wenner, C., Thaman, K., Tashev, V., Neo, C., Kran, E., and Schreiber, J · 2024
Cited alongside, same era.
An Overview of Catastrophic AI Risks
Hendrycks, D., Mazeika, M., and Woodside, T · 2024
Cited alongside, same era.
Advanced AI evaluations at AISI: May update | AISI Work
Institute, U. A. S · 2024
Cited alongside, same era.
Managing Misuse Risk for Dual-Use Foundation Models
Nist, G. M · 2024
Closest in time.
Gpt-4o mini: advancing cost-efficient intelligence
OpenAI · 2024
Closest in time.
o1-system-card-20240917.pdf
OpenAI · 2024
Closest in time.
OpenAI, Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., Avila, R., Babuschkin, I., Balaji, S., Balcom, V., Baltescu, P., Bao, H., Bavarian, M., Belgum, J., Bello, I., Berdine, J., Bernadett-Shapiro, G., Berner, C., Bogdonoff, L., Boiko, O., Boyd, M., Brakman, A.-L., Brockman, G., Brooks, T., Brundage, M., Button, K., Cai, T., Campbell, R., Cann, A., Carey, B., Carlson, C., Carmichael, R., Chan, B., Chang, C., Chantzis, F., Chen, D., Chen, S., Chen, R., Chen, J., Chen, M., Chess, B., Cho, C., Chu, C., Chung, H. W., Cummings, D., Currier, J., Dai, Y., Decareaux, C., Degry, T., Deutsch, N., Deville, D., Dhar, A., Dohan, D., Dowling, S., Dunning, S., Ecoffet, A., Eleti, A., Eloundou, T., Farhi, D., Fedus, L., Felix, N., Fishman, S. P., Forte, J., Fulford, I., Gao, L., Georges, E., Gibson, C., Goel, V., Gogineni, T., Goh, G., Gontijo-Lopes, R., Gordon, J., Grafstein, M., Gray, S., Greene, R., Gross, J., Gu, S. S., Guo, Y., Hallacy, C., Han, J., Harris, J., He, Y., Heaton, M., Heidecke, J., Hesse, C., Hickey, A., Hickey, W., Hoeschele, P., Houghton, B., Hsu, K., Hu, S., Hu, X., Huizinga, J., Jain, S., Jain, S., Jang, J., Jiang, A., Jiang, R., Jin, H., Jin, D., Jomoto, S., Jonn, B., Jun, H., Kaftan, T., Łukasz Kaiser, Kamali, A., Kanitscheider, I., Keskar, N. S., Khan, T., Kilpatrick, L., Kim, J. W., Kim, C., Kim, Y., Kirchner, J. H., Kiros, J., Knight, M., Kokotajlo, D., Łukasz Kondraciuk, Kondrich, A., Konstantinidis, A., Kosic, K., Krueger, G., Kuo, V., Lampe, M., Lan, I., Lee, T., Leike, J., Leung, J., Levy, D., Li, C. M., Lim, R., Lin, M., Lin, S., Litwin, M., Lopez, T., Lowe, R., Lue, P., Makanju, A., Malfacini, K., Manning, S., Markov, T., Markovski, Y., Martin, B., Mayer, K., Mayne, A., McGrew, B., McKinney, S. M., McLeavey, C., McMillan, P., McNeil, J., Medina, D., Mehta, A., Menick, J., Metz, L., Mishchenko, A., Mishkin, P., Monaco, V., Morikawa, E., Mossing, D., Mu, T., Murati, M., Murk, O., Mély, D., Nair, A., Nakano, R., Nayak, R., Neelakantan, A., Ngo, R., Noh, H., Ouyang, L., O’Keefe, C., Pachocki, J., Paino, A., Palermo, J., Pantuliano, A., Parascandolo, G., Parish, J., Parparita, E., Passos, A., Pavlov, M., Peng, A., Perelman, A., de Avila Belbute Peres, F., Petrov, M., de Oliveira Pinto, H. P., Michael, Pokorny, Pokrass, M., Pong, V. H., Powell, T., Power, A., Power, B., Proehl, E., Puri, R., Radford, A., Rae, J., Ramesh, A., Raymond, C., Real, F., Rimbach, K., Ross, C., Rotsted, B., Roussez, H., Ryder, N., Saltarelli, M., Sanders, T., Santurkar, S., Sastry, G., Schmidt, H., Schnurr, D., Schulman, J., Selsam, D., Sheppard, K., Sherbakov, T., Shieh, J., Shoker, S., Shyam, P., Sidor, S., Sigler, E., Simens, M., Sitkin, J., Slama, K., Sohl, I., Sokolowsky, B., Song, Y., Staudacher, N., Such, F. P., Summers, N., Sutskever, I., Tang, J., Tezak, N., Thompson, M. B., Tillet, P., Tootoonchian, A., Tseng, E., Tuggle, P., Turley, N., Tworek, J., Uribe, J. F. C., Vallone, A., Vijayvergiya, A., Voss, C., Wainwright, C., Wang, J. J., Wang, A., Wang, B., Ward, J., Wei, J., Weinmann, C., Welihinda, A., Welinder, P., Weng, J., Weng, L., Wiethoff, M., Willner, D., Winter, C., Wolrich, S., Wong, H., Workman, L., Wu, S., Wu, J., Wu, M., Xiao, K., Xu, T., Yoo, S., Yu, K., Yuan, Q., Zaremba, W., Zellers, R., Zhang, C., Zhang, M., Zhao, S., Zheng, T., Zhuang, J., Zhuk, W., and Zoph, B · 2024
Closest in time.
Evaluating Frontier Models for Dangerous Capabilities, April 2024
Phuong, M., Aitchison, M., Catt, E., Cogan, S., Kaskasoli, A., Krakovna, V., Lindner, D., Rahtz, M., Assael, Y., Hodkinson, S., Howard, H., Lieberum, T., Kumar, R., Raad, M. A., Webson, A., Ho, L., Lin, S., Farquhar, S., Hutter, M., Deletang, G., Ruoss, A., El-Sayed, S., Brown, S., Dragan, A., Shah, R., Dafoe, A., and Shevlane, T · 2024
Closest in time.
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
Rivera, J.-P., Mukobi, G., Reuel, A., Lamparth, M., Smith, C., and Schneider, J · 2024
Closest in time.
Sclar, M., Choi, Y., Tsvetkov, Y., and Suhr, A · 2024
Closest in time.
Shao, M., Jancheska, S., Udeshi, M., Dolan-Gavitt, B., Xi, H., Milner, K., Chen, B., Yin, M., Garg, S., Krishnamurthy, P., Khorrami, F., Karri, R., and Shafique, M · 2024
Closest in time.
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors, June 2024
Xie, T., Qi, X., Zeng, Y., Huang, Y., Sehwag, U. M., Huang, K., He, L., Wei, B., Li, D., Sheng, Y., Jia, R., Li, B., Li, K., Chen, D., Henderson, P., and Mittal, P · 2024
Closest in time.
Qwen2 Technical Report, September 2024
Yang, A., Yang, B., Hui, B., Zheng, B., Yu, B., Zhou, C., Li, C., Li, C., Liu, D., Huang, F., Dong, G., Wei, H., Lin, H., Tang, J., Wang, J., Yang, J., Tu, J., Zhang, J., Ma, J., Yang, J., Xu, J., Zhou, J., Bai, J., He, J., Lin, J., Dang, K., Lu, K., Chen, K., Yang, K., Li, M., Xue, M., Ni, N., Zhang, P., Wang, P., Peng, R., Men, R., Gao, R., Lin, R., Wang, S., Bai, S., Tan, S., Zhu, T., Li, T., Liu, T., Ge, W., Deng, X., Zhou, X., Ren, X., Zhang, X., Wei, X., Ren, X., Liu, X., Fan, Y., Yao, Y., Zhang, Y., Wan, Y., Chu, Y., Liu, Y., Cui, Z., Zhang, Z., Guo, Z., and Fan, Z · 2024
Closest in time.
Cybench: A framework for evaluating cybersecurity capabilities and risks of language models, 2024
Zhang, A. K., Perry, N., Dulepet, R., Ji, J., Lin, J. W., Jones, E., Menders, C., Hussein, G., Liu, S., Jasper, D., Peetathawatchai, P., Glenn, A., Sivashankar, V., Zamoshchin, D., Glikbarg, L., Askaryar, D., Yang, M., Zhang, T., Alluri, R., Tran, N., Sangpisit, R., Yiorkadjis, P., Osele, K., Raghupathi, G., Boneh, D., Ho, D. E., and Liang, P · 2024
Closest in time.
A Survey on Large Language Model based Autonomous Agents
Wang, L., Ma, C., Feng, X., Zhang, Z., Yang, H., Zhang, J., Chen, Z., Tang, J., Chen, X., Lin, Y., Zhao, W. X., Wei, Z., and Wen, J.-R · 2095
Closest in time.