RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
arxiv.org · 6,932 words · saved by 1 readers
N/A
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold 1 1 2 3 1 2 Amrith Setlur , Saurabh Garg , Xinyang (Young) Geng , Naman Garg , Virginia Smith and Aviral Kumar 1 2 3 Carnegie Mellon…
related reading
- [2409.19759] Balancing Cost and Effectiveness of Synthetic Data Generation Strategies for LLMsarxiv.org
- As Rocks May Think | Eric Jangevjang.com
- DeepSeek-R1arxiv.org
- RLHF: Reinforcement Learning from Human Feedbackhuyenchip.com
- State of RL for reasoning LLMs | A. Weersaweers.de
- Noisy Data Breaks RLVRddkang.substack.com
- LLM Reasoning via One Examplearxiv.org
- Synthetic Pretraining | Vintage Datavintagedata.org
- How to Generate and Use Synthetic Data for Finetuningeugeneyan.com
- Recent LLMs can use filler tokens or problem repeats to improve (no-CoT) math performanceblog.redwoodresearch.org
- Let's Verify Step by Steparxiv.org
- dennyzhou.github.io/LLM-Reasoning-Stanford-CS-25.pdfdennyzhou.github.io