Collin Burns
I recently left OpenAI, where I did research on superalignment. Before joining OpenAI, I was a PhD student at Berkeley. My current research interests include (1) studying "weak-to-strong" generalization, (2) developing unsupervised methods for making language models honest, and (3) understanding when and how high-level abstractions are encoded in representations. Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Collin Burns†, Pavel Izmailov†, Jan Hendrik Kirchner†, Bowen Baker†, Leo Gao†, Leopold Aschenbrenner†, Yining Chen†, Adrien Ecoffet†, Manas Joglekar†, Jan Leike, Ilya Sutskever, Jeff Wu† ICML 2024 (Oral) Discovering Latent Knowledge in Language Models Without Supervision Collin Burns*, Haotian Ye*, Dan Klein, Jacob Steinhardt ICLR 2023 Measuring Mathematical Problem Solving With the MATH Dataset Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, Jacob Steinhardt NeurIPS 2021 (Datasets and Benchmarks Tr
Collin Burns Select Papers Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Collin Burns† , Pavel Izmailov†, Jan Hendrik Kirchner†, Bowen Baker†, Leo Gao†, Leopold Aschenbrenner†, Yining Chen†, Adrien Ecoffet†, Manas Joglekar†, Jan Leike, Ilya Sutskever, Jeff Wu† ICML 2024 (Oral) Discovering Latent Knowledge in Language Models Without Supervision Collin Burns* , Haotian Ye*, Dan Klein, Jacob Steinhardt ICLR 2023 Measuring Mathematical Problem Solving With the MATH Dataset Dan Hendrycks, Collin Burns , Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn
Explore this link on the map →related reading
- Automated Weak-to-Strong Researcheralignment.anthropic.com
- Tracing the thoughts of a large language model \ Anthropicanthropic.com
- Automated Alignment Researchers: Using large language models to scale scalable oversight \ Anthropicanthropic.com
- Alignment remains a hard, unsolved problem — LessWronglesswrong.com
- GitHub - jacobhilton/deep_learning_curriculum: Language model alignment-focused deep learning curriculum · GitHubgithub.com
- Just Ask for Generalization | Eric Jangevjang.com
- Explore | alphaXivalphaxiv.org
- Mathematics in the Library of Babel - Daniel Littdaniellitt.com
- [2312.09390] Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervisionar5iv.labs.arxiv.org
- Learning to reason with LLMs | OpenAIopenai.com
- [2604.22082] Removing Sandbagging in LLMs by Training with Weak Supervisionarxiv.org
- To Understand Language is to Understand Generalization | Eric Jangevjang.com