How far does alignment midtraining generalize?
alignment.openai.com · 2,588 words · saved by 3 readers
Preliminary experiments on alignment and misalignment midtraining, reasoning posttraining, and generalization to chat and agentic evals.
How far does alignment midtraining generalize? ← Back to OpenAI Alignment Blog How far does alignment midtraining generalize? Mar 27, 2026 · Tomek Korbak, Cameron Raymond, Micah Carroll, Marcus Williams, Mikita Balesni, Alan Guo, Jason Wolfe, Akshay Jagadeesh, Ian Kivlichan Today’s AI agents are based on large language models (LLMs) that draw their knowledge and expectations from vast amounts of internet text. This means that AI agents are exposed to AI safety discourse, including discussions of AI misalignment risk and depictions of humans losing control over malicious AI agents, which could
saved by
related reading
- Alignment remains a hard, unsolved problem — LessWronglesswrong.com
- Narrow Misalignment is Hard, Emergent Misalignment is Easy — LessWronglesswrong.com
- Teaching Claude Whyalignment.anthropic.com
- Model Spec Midtraining: Improving How Alignment Training Generalizesalignment.anthropic.com
- Reinforcement learning towards broadly and persistently beneficial modelsalignment.openai.com
- Self-Fulfilling Misalignment Data Might Be Poisoning Our AI Modelsturntrout.com
- Alignment is not solved but it increasingly looks solvablealigned.substack.com
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment — LessWronglesswrong.com
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignmentalignmentpretraining.ai
- Teaching Claude why \ Anthropicanthropic.com
- Alignment Faking Mitigationsalignment.anthropic.com
- [2502.17424] Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMsarxiv.org