flâneur

LLM Reasoning via One Example

arxiv.org · 6,966 words · saved by 1 readers

N/A

Reinforcement Learning for Reasoning in Large Language Models with One Training Example Yiping Wang1 † ∗ Qing Yang2 Zhiyuan Zeng1 Liliang Ren3 Liyuan Liu3 Baolin Peng3 Hao Cheng3 Xuehai He4 Kuan Wang5 Jianfeng Gao3 arXiv:2504.20571v3 [cs.LG] 24 Oct 2025 Weizhu Chen3 Shuohang Wang3 † Simon Shaolei Du1 † Yelong Shen3 †…

related reading