flâneur — a map of the web's best reading

Model Organisms for Emergent Misalignment — LessWrong

lesswrong.com · 5,362 words · saved by 1 readers

We show emergent misalignment is a robust and safety-relevant result, and open-source improved model organisms to accelerate future work.

x Model Organisms for Emergent Misalignment — LessWrong Emergent Misalignment MATS Program Interpretability (ML & AI) AI Frontpage 2025 Top Fifty: 15 % 120 Model Organisms for Emergent Misalignment by Anna Soligo , Edward Turner , Mia Taylor , Senthooran Rajamanoharan , Neel Nanda 16th Jun 2025 AI Alignment Forum 7 min read 19 120 Ω 56 Ed and Anna are co-first authors on this work. TL;DR Emergent Misalignment (EM) showed that fine-tuning LLMs on insecure code caused them to become broadly misaligned. We show this is a robust and safety-relevant result, and open-source improved model organisms

Explore this link on the map →

saved by

related reading