2310.01405
arxiv.org · 7,815 words · saved by 2 readers
N/A
R EPRESENTATION E NGINEERING : A T OP -D OWN A PPROACH TO AI T RANSPARENCY Andy Zou1,2 , Long Phan∗1 , Sarah Chen∗1,4 , James Campbell∗7 , Phillip Guo∗6 , Richard Ren∗8 , Alexander Pan3 , Xuwang Yin1 , Mantas Mazeika1,9 , Ann-Kathrin Dombrowski1 , Shashwat Goel1 , Nathaniel Li1,3 , Michael J. Byun4 , Zifan Wang1 , Alex Mallen5 , Steven Basart1 ,…
saved by
related reading
- 2310.01405.pdfarxiv.org
- [2310.01405] Representation Engineering: A Top-Down Approach to AI Transparencyarxiv.org
- 2212.03827arxiv.org
- Representation Engineering: a New Way of Understanding Models | CAISsafe.ai
- Transformer Circuits Threadtransformer-circuits.pub
- An Extremely Opinionated Annotated List of My Favourite Mechanistic Interpretability Papers v2 — AI Alignment Forumalignmentforum.org
- Mapping the Mind of a Large Language Model \ Anthropicanthropic.com
- A Pragmatic Vision for Interpretability — AI Alignment Forumalignmentforum.org
- Structure and Interpretation of Deep Networkssidn.baulab.info
- An Extremely Opinionated Annotated List of My Favourite Mechanistic Interpretability Papers v2 — AI Alignment Forumalignmentforum.org
- Neuronpedianeuronpedia.org
- Interpretability Dreamstransformer-circuits.pub