flâneur

Inference-Time Reward Hacking in Large Language Models

arxiv.org · 7,539 words · saved by 1 readers

N/A

Inference-Time Reward Hacking in Large Language Models Hadi Khalaf∗ Claudio Mayrink Verdun Alex Oesterling Harvard University Harvard University Harvard University Himabindu Lakkaraju Flavio du Pin Calmon∗ arXiv:2506.19248v2 [cs.LG] 4 Nov 2025…

related reading