Student Projects - CS 2881R AI Safety | CS 2881 AI Safety
boazbk.github.io · 1,384 words · saved by 1 readers
Harvard CS 2881R
Harvard CS 2881R Student Final Projects - Fall 2025 This page showcases the final research projects from CS 2881R: AI Safety. Students conducted original research on topics spanning interpretability, alignment, adversarial robustness, and AI governance. Video of oral presentations Mechanisms of Subliminal Learning Subliminal learning is a recently discovered failure mode of distillation and post-training where a student model inherits a teacher's hidden traits (e.g., "liking owls") from data that appears semantically unrelated (e.g., number lists). We study the mechanisms of subliminal…
saved by
related reading
- Introspection Adapters: Training LLMs to Report Their Learned Behaviorsarxiv.org
- Subliminal Learning: Language Models Transmit Behavioral Traits via Hidden Signals in Dataalignment.anthropic.com
- AI in 2025: gestalt — LessWronglesswrong.com
- [2502.17424] Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMsarxiv.org
- ARENA - AI Safety Curriculumlearn.arena.education
- [2401.05566] Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Trainingarxiv.org
- [2606.00831] Subliminal Learning is a LoRA Artifactarxiv.org
- [2607.14111] Introspection Fine-Tuning (IFT): Training Small LLMs to Introspectarxiv.org
- [2604.16812] Introspection Adapters: Training LLMs to Report Their Learned Behaviorsarxiv.org
- [2512.11949] Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitorsarxiv.org
- [2312.06942] AI Control: Improving Safety Despite Intentional Subversionarxiv.org
- Refusal in LLMs is mediated by a single direction — LessWronglesswrong.com