Auditing language models for hidden objectives — LessWrong
We study alignment audits—systematic investigations into whether an AI is pursuing hidden objectives—by training a model with a hidden misaligned obj…
x Auditing language models for hidden objectives — LessWrong AI Auditing Interpretability (ML & AI) AI Frontpage 2025 Top Fifty: 9 % 153 Auditing language models for hidden objectives by Sam Marks , Johannes Treutlein , dmz , Sam Bowman , Hoagy , Carson Denison , Kei Nishimura-Gasparian , 7vik , Akbir Khan , Austin Meek , Euan Ong , Christopher Olah , Fabien Roger , jeanne_ , Meg , Drake Thomas , Adam Jermyn , Monte M , evhub 13th Mar 2025 AI Alignment Forum 15 min read 15 153 Ω 84 We study alignment audits —systematic investigations into whether an AI is pursuing hidden objectives—by training
Explore this link on the map →saved by
related reading
- Auditing language models for hidden objectives \ Anthropicanthropic.com
- [2503.10965] Auditing language models for hidden objectivesarxiv.org
- [2602.22755] AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviorsarxiv.org
- Building and evaluating alignment auditing agents — AI Alignment Forumalignmentforum.org
- AuditBenchalignment.anthropic.com
- [2602.22755] AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviorsarxiv.org
- Natural Language Autoencoders \ Anthropicanthropic.com
- Building and evaluating alignment auditing agentsalignment.anthropic.com
- Externalized reasoning oversight: a research direction for language model alignment — AI Alignment Forumalignmentforum.org
- Natural-emergent-misalignment-from-reward-hacking-paper.pdfassets.anthropic.com
- How confessions can keep language models honest | OpenAIopenai.com
- [2604.16812] Introspection Adapters: Training LLMs to Report Their Learned Behaviorsarxiv.org