LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
arxiv.org · 5,146 words · saved by 1 readers
N/A
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions WARNING: This paper contains model outputs that may be considered offensive. Xuhao Hu1,2 Peng Wang1,3 Xiaoya Lu1,4 Dongrui Liu1‡ Xuanjing Huang2 Jing Shao1† 1…
saved by
related reading
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment — LessWronglesswrong.com
- [2502.17424] Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMsarxiv.org
- Alignment is not solved but it increasingly looks solvablealigned.substack.com
- Models don’t seem to be dishonest in the way humans are — LessWronglesswrong.com
- Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs 49 This paper contains model-generated content that might be offensive. 49arxiv.org
- Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignmentalignmentpretraining.ai
- Modifying LLM Beliefs with Synthetic Document Finetuningalignment.anthropic.com
- Narrow Misalignment is Hard, Emergent Misalignment is Easy — LessWronglesswrong.com
- Emergent Misalignment is Easy, Narrow Misalignment is Hardarxiv.org
- Model Organisms for Emergent Misalignment — LessWronglesswrong.com
- Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMsarxiv.org
- Agentic Misalignment: How LLMs Could be Insider Threats — LessWronglesswrong.com