[2601.10160] Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment
Abstract:Pretraining corpora contain extensive discourse about AI systems, yet the causal influence of this discourse on downstream alignment remains poorly understood. If prevailing descriptions of AI behaviour are predominantly negative, LLMs may internalise corresponding behavioural priors, giving rise to self-fulfilling misalignment. This paper provides the first controlled study of this hypothesis by pretraining 6.9B-parameter LLMs with varying amounts of (mis)alignment discourse. We find that discussion of AI contributes to misalignment. Upsampling synthetic training documents about AI misalignment leads to a notable increase in misaligned behaviour. Conversely, upsampling documents about aligned behaviour reduces misalignment scores from 45% to 9%. We consider this evidence of self-fulfilling alignment. These effects are dampened, but persist through post-training. Our findings establish the study of how pretraining data shapes alignment priors, or alignment pretraining, as a complement to post-training. We recommend practitioners consider pretraining for alignment alongside capabilities. We share our models, data, and evaluations at this http URL.
[2601.10160] Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment Skip to main content arXiv is now an independent nonprofit! Learn more × Search arXiv Press Enter to search · Advanced search --> Computer Science > Computation and Language arXiv:2601.10160 (cs) [Submitted on 15 Jan 2026 ( v1 ), last revised 19 Feb 2026 (this version, v2)] Title: Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment Authors: Cameron Tice , Puria Radmard , Samuel Ratnam , Andy Kim , David Africa , Kyle O'Brien View a PDF of the paper titled Alignment Pretrain
saved by
related reading
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignmentalignmentpretraining.ai
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment — LessWronglesswrong.com
- Synthetic Persona Pretraining: Alignment from Token Zeromodelraising.ai
- Alignment remains a hard, unsolved problem — LessWronglesswrong.com
- Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggersarxiv.org
- Narrow Misalignment is Hard, Emergent Misalignment is Easy — LessWronglesswrong.com
- Thousand-dimensional structure — Resolutionresolution.org
- Alignment is not solved but it increasingly looks solvablealigned.substack.com
- Self-CTRL: Self-Consistency Training with Reinforcement Learningarxiv.org
- [2502.17424] Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMsarxiv.org
- Self-Fulfilling Misalignment Data Might Be Poisoning Our AI Modelsturntrout.com
- Teaching Claude Whyalignment.anthropic.com