Measuring disentanglement: A review of metrics, 2022
M.-A. Carbonneau, J. Zaidi, J. Boilard, and G. Gagnon · 2022
Cited alongside, same era.
Toy models of superposition, 2022
N. Elhage, T. Hume, C. Olsson, N. Schiefer, T. Henighan, S. Kravec, Z. Hatfield-Dodds, R. Lasenby, D. Drain, C. Chen, R. Grosse, S. McCandlish, J. Kaplan, D. Amodei, M. Wattenberg, and C. Olah · 2022
Cited alongside, same era.
X-risk analysis for ai research, 2022
D. Hendrycks and M. Mazeika · 2022
Cited alongside, same era.
Locating and editing factual associations in gpt
K. Meng, D. Bau, A. Andonian, and Y. Belinkov · 2022
Cited alongside, same era.
Mechanistic interpretability analysis of grokking
N. Nanda and T. Lieberum · 2022
Cited alongside, same era.
Toward transparent ai: A survey on interpreting the inner structures of deep neural networks
Original
T. Räuker, A. Ho, S. Casper, and D. Hadfield-Menell · 2022
Cited alongside, same era.
Measuring value alignment, 2023
F. Barez and P. Torr · 2023
Cited alongside, same era.
System iii: Learning with domain knowledge for safety constraints, 2023
F. Barez, H. Hasanbieg, and A. Abbate · 2023
Cited alongside, same era.
Neuron to graph: Interpreting language model neurons at scale, 2023
A. Foote, N. Nanda, E. Kran, I. Konstas, S. Cohen, and F. Barez · 2023
Cited alongside, same era.
Towards automated circuit discovery for mechanistic interpretability, 04 2023a
A. Conmy, A. Mavor-Parker, A. Lynch, S. Heimersheim, and A. Garriga-Alonso
Cited in the paper.
Towards automated circuit discovery for mechanistic interpretability, 2023b
A. Conmy, A. N. Mavor-Parker, A. Lynch, S. Heimersheim, and A. Garriga-Alonso
Cited in the paper.
Zoom in: An introduction to circuits
C. Olah, N. Cammarata, L. Schubert, G. Goh, M. Petrov, and S. Carter
Cited in the paper.