flâneur

Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences

arxiv.org · 7,784 words · saved by 1 readers

N/A

Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences Corby Rosset∗ Ching-An Cheng Arindam Mitra Michael Santacroce Ahmed Awadallah∗ Tengyang Xie∗ Microsoft Research arXiv:2404.03715v1 [cs.LG] 4 Apr 2024…

related reading