Synthetic Persona Pretraining: Alignment from Token Zero — LessWrong
Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Kartik Bali, Yiderigun Borjigin, Shaobo Cui, Stefan Krsteski, Ashton Anderson, Rolan…
x Synthetic Persona Pretraining: Alignment from Token Zero — LessWrong MATS Program AI Safety Alignment Pretraining LLM Personas AI Frontpage 2026 Top Fifty: 14 % 112 Synthetic Persona Pretraining: Alignment from Token Zero by Julian Minder , Raghav Singhal , Viktor Moskvoretskii , Stefan Krsteski , ashtonanderson , rolandaydin , Robert West 20th May 2026 20 min read 26 112 Julian Minder , Viktor Moskvoretskii , Raghav Singhal , Difan Jiao, Kartik Bali, Yiderigun Borjigin, Shaobo Cui, Stefan Krsteski, Ashton Anderson, Roland Aydin, Robert West ( equal contribution ) These are early results, bu
Explore this link on the map →saved by
related reading
- Teaching Claude why \ Anthropicanthropic.com
- The Persona Selection Model: Why AI Assistants might Behave like Humansalignment.anthropic.com
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment — LessWronglesswrong.com
- llm assistant personas seem increasingly incoherent (some subjective observations) — LessWronglesswrong.com
- Guardian Angels: LLM Personalization for Productivity and Security · Gwern.netgwern.net
- Alignment pretraining could backfire — LessWronglesswrong.com
- Alignment remains a hard, unsolved problem — LessWronglesswrong.com
- The persona selection model — LessWronglesswrong.com
- “Alignment Faking” frame is somewhat fake — LessWronglesswrong.com
- Self-Fulfilling Misalignment Data Might Be Poisoning Our AI Modelsturntrout.com
- Claude is Now Alignment-Pretrained — LessWronglesswrong.com
- Alignment faking in large language modelsarxiv.org