Fetching the paper…

TracrBench: Generating Interpretability Testbeds with Large Language Models · Around