flâneur

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

arxiv.org · 7,267 words · saved by 1 readers

N/A

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning J1: I NCENTIVIZING T HINKING IN LLM- AS - A -J UDGE VIA R EINFORCEMENT L EARNING Chenxi Whitehouse Tianlu Wang Ping Yu Xian Li Jason Weston Ilia Kulikov Swarnadeep Saha FAIR at Meta chenxwh@meta.com, swarnadeep@meta.com…

related reading