flâneur
A simple technical explanation of RLH(AI)F | Kairos.fm
kairos.fm
· saved by 2 readers
Understanding reinforcement learning from human, or AI, feedback.
saved by
Alex Yun
Jackson Kozlowski