Fetching the paper…

SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability · Around