flâneur

SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability

arxiv.org · 6,315 words · saved by 1 readers

N/A

SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability Adam Karvonen * 1 Can Rager * 1 Johnny Lin * 2 Curt Tigges * 2 Joseph Bloom * 2 David Chanin 3 Yeu-Tong Lau 1 Eoin Farrell 1 Callum McDougall Kola Ayonrinde Demian Till 4 Matthew Wearden 5 Arthur Conmy Samuel Marks 6 Neel Nanda…

related reading