flâneur — a map of the web's best reading

Collin Burns

collinpburns.com · 166 words · saved by 1 readers

I recently left OpenAI, where I did research on superalignment. Before joining OpenAI, I was a PhD student at Berkeley. My current research interests include (1) studying "weak-to-strong" generalization, (2) developing unsupervised methods for making language models honest, and (3) understanding when and how high-level abstractions are encoded in representations. Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Collin Burns†, Pavel Izmailov†, Jan Hendrik Kirchner†, Bowen Baker†, Leo Gao†, Leopold Aschenbrenner†, Yining Chen†, Adrien Ecoffet†, Manas Joglekar†, Jan Leike, Ilya Sutskever, Jeff Wu† ICML 2024 (Oral) Discovering Latent Knowledge in Language Models Without Supervision Collin Burns*, Haotian Ye*, Dan Klein, Jacob Steinhardt ICLR 2023 Measuring Mathematical Problem Solving With the MATH Dataset Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, Jacob Steinhardt NeurIPS 2021 (Datasets and Benchmarks Tr

Collin Burns Select Papers Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Collin Burns† , Pavel Izmailov†, Jan Hendrik Kirchner†, Bowen Baker†, Leo Gao†, Leopold Aschenbrenner†, Yining Chen†, Adrien Ecoffet†, Manas Joglekar†, Jan Leike, Ilya Sutskever, Jeff Wu† ICML 2024 (Oral) Discovering Latent Knowledge in Language Models Without Supervision Collin Burns* , Haotian Ye*, Dan Klein, Jacob Steinhardt ICLR 2023 Measuring Mathematical Problem Solving With the MATH Dataset Dan Hendrycks, Collin Burns , Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn

Explore this link on the map →

related reading