flâneur

Open Problems of Reinforcement Learning

arxiv.org · 8,513 words · saved by 1 readers

N/A

Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback Stephen Casper,∗ MIT CSAIL, scasper@mit.edu Xander Davies,∗ Harvard University Claudia Shi, Columbia University Thomas Krendl Gilbert, Cornell Tech Jérémy Scheurer, Apollo Research Javier Rando, ETH Zurich…

related reading