LLM Reasoning via One Example
arxiv.org · 6,966 words · saved by 1 readers
N/A
Reinforcement Learning for Reasoning in Large Language Models with One Training Example Yiping Wang1 † ∗ Qing Yang2 Zhiyuan Zeng1 Liliang Ren3 Liyuan Liu3 Baolin Peng3 Hao Cheng3 Xuehai He4 Kuan Wang5 Jianfeng Gao3 arXiv:2504.20571v3 [cs.LG] 24 Oct 2025 Weizhu Chen3 Shuohang Wang3 † Simon Shaolei Du1 † Yelong Shen3 †…
related reading
- [2504.13837] Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?arxiv.org
- DeepSeek-R1arxiv.org
- The State of Reinforcement Learning for LLM Reasoningmagazine.sebastianraschka.com
- State of RL for reasoning LLMs | A. Weersaweers.de
- As Rocks May Think | Eric Jangevjang.com
- Reasoning in General Domains without Verifiersarxiv.org
- Limit of RLVRlimit-of-rlvr.github.io
- The State of Reinforcement Learning for LLM Reasoningsebastianraschka.com
- Explore | alphaXivalphaxiv.org
- [2201.11903] Chain of Thought Prompting Elicits Reasoning in Large Language Modelsarxiv.org
- You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectoriesarxiv.org
- Understanding R1-Zero-Like Training: A Critical Perspectivearxiv.org