Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
arxiv.org · 7,784 words · saved by 1 readers
N/A
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences Corby Rosset∗ Ching-An Cheng Arindam Mitra Michael Santacroce Ahmed Awadallah∗ Tengyang Xie∗ Microsoft Research arXiv:2404.03715v1 [cs.LG] 4 Apr 2024…
related reading
- [2305.18290] Direct Preference Optimization: Your Language Model is Secretly a Reward Modelarxiv.org
- Fine-tune Llama 2 with DPOhuggingface.co
- RLHF & Post-Training Course by Nathan Lambertrlhfbook.com
- Nash Learning from Human Feedbackarxiv.org
- [2305.18290] Direct Preference Optimization: Your Language Model is Secretly a Reward Modelarxiv.org
- RLHF | John Lambertjohnwlambert.github.io
- RLHF: Reinforcement Learning from Human Feedbackhuyenchip.com
- Direct Preference Optimization with Dynamic $\beta$neurips.cc
- 2401.10020.pdfarxiv.org
- rlhfbook.com/book.pdfrlhfbook.com
- State of RL for reasoning LLMs | A. Weersaweers.de
- Preference Tuning LLMs with Direct Preference Optimization Methodshuggingface.co