Fetching the paper…
Reading the bibliography…
Recent advancements in large language models (LLMs) have resulted in increasingly anthropomorphic language concerning the ability of LLMs to reason.
On the Measure of Intelligence, November 2019
François Chollet · 1911
Earlier work this paper cites.
Language Models are Few-Shot Learners, July 2020
Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, and Dario Amodei · 2005
Earlier work this paper cites.
How We Reason
Philip Johnson-Laird · 2008
Earlier work this paper cites.
Layer Normalization, July 2016
Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E. Hinton · 2016
Earlier work this paper cites.
Attention Is All You Need, August 2017
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin · 2017
Earlier work this paper cites.
A Mathematical Framework for Transformer Circuits, December 2021
Nelson Elhage, Neel Nanda, Catherine Olsson, Tom Henighan, and Nicholas Joseph · 2021
Earlier work this paper cites.
Symbols and grounding in large language models
Ellie Pavlick · 2022
Earlier work this paper cites.
Kevin Wang, Alexandre Variengien, Arthur Conmy, Buck Shlegeris, and Jacob Steinhardt · 2022
Cited alongside, same era.
Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling, May 2023
Stella Biderman, Hailey Schoelkopf, Quentin Anthony, Herbie Bradley, Kyle O’Brien, Eric Hallahan, Mohammad Aflah Khan, Shivanshu Purohit, USVSN Sai Prashanth, Edward Raff, Aviya Skowron, Lintang Sutawika, and Oskar van der Wal · 2023
Cited alongside, same era.
Towards Monosemanticity: Decomposing Language Models With Dictionary Learning
Trenton Bricken, Adly Templteon, Joshua Batson, Brian Chen, and Adam Jermyn · 2023
Cited alongside, same era.
In-Context Learning Creates Task Vectors
Roee Hendel, Mor Geva, and Amir Globerson · 2023
Cited alongside, same era.
Sparse Autoencoders Find Highly Interpretable Features in Language Models
Robert Huben, Hoagy Cunningham, Logan Riggs Smith, Aidan Ewart, and Lee Sharkey · 2023
Representation Engineering: A Top-Down Approach to AI Transparency, October 2023
Andy Zou, Long Phan, Sarah Chen, James Campbell, Phillip Guo, Richard Ren, Alexander Pan, Xuwang Yin, Mantas Mazeika, Ann-Kathrin Dombrowski, Shashwat Goel, Nathaniel Li, Michael J. Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, J. Zico Kolter, and Dan Hendrycks · 2023
Later among the works it cites.
Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models, March 2024
Adam Karvonen · 2024
Later among the works it cites.
Philipp Mondorf and Barbara Plank · 2024
Later among the works it cites.
Learning to Reason with LLMs, September 2024
OpenAI · 2024
Later among the works it cites.
EleutherAI/lm-evaluation-harness: v0.4.3, July 2024
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Sheng Liu, Haotian Ye, Lei Xing, and James Zou · 2023
Cited alongside, same era.
Emergent Linear Representations in World Models of Self-Supervised Sequence Models
Neel Nanda, Andrew Lee, and Martin Wattenberg · 2023
Cited alongside, same era.
Locating and Editing Factual Associations in GPT, January 2023a
Kevin Meng, David Bau, Alex Andonian, and Yonatan Belinkov
Cited in the paper.
Mass-Editing Memory in a Transformer, August 2023b
Kevin Meng, Arnab Sen Sharma, Alex Andonian, Yonatan Belinkov, and David Bau
Cited in the paper.
Lintang Sutawika, Hailey Schoelkopf, Leo Gao, Baber Abbasi, Stella Biderman, Jonathan Tow, ben fattori, Charles Lovering, farzanehnakhaee70, Jason Phang, Anish Thite, Fazz, Aflah, Niklas Muennighoff, Thomas Wang, sdtblck, nopperl, gakada, tttyuntian, researcher2, Julen Etxaniz, Chris, Hanwool Albert Lee, Zdeněk Kasner, Khalid, LSinev, Jeffrey Hsu, Anjor Kanekar, KonradSzafer, and AndyZwei · 2024
Later among the works it cites.
Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, May 2024
Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, and Trenton Bricken · 2024
Later among the works it cites.
Function Vectors in Large Language Models, February 2024
Eric Todd, Millicent L. Li, Arnab Sen Sharma, Aaron Mueller, Byron C. Wallace, and David Bau · 2024
Later among the works it cites.