flâneur — a map of the web's best reading

Are AIs more likely to pursue on-episode or beyond-episode reward?

blog.redwoodresearch.org · saved by 1 readers

RL would encourage on-episode reward seeking, but beyond-episode reward seekers may learn to goal-guard.

Explore this link on the map →