emparu/Evolution-Strategies-LLMs: Evolutionary Strategies for RL in LLMs.
github.com · 322 words · saved by 1 readers
Evolutionary Strategies for RL in LLMs.
Link to Kaggle notebook: https://www.kaggle.com/code/emanuelruzak/evolutonstrategiesv2 Comment: The huggingface API key is not a working key. In "Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning" (Qiu et al., 2025), a method based on evolutionary strategies (ES) was introduced for reinforcement learning in LLMs. The method, on each iteration, consists basically of generating K perturbed versions of an LLM by adding noise to its weights, calculating the reward for each perturbed version, and finally reweighting the perturbations by the z-score and adding them to the
related reading
- State of RL for reasoning LLMs | A. Weersaweers.de
- [2509.24372] Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learningarxiv.org
- A vision researcher’s guide to some RL stuff: PPO & GRPO - Yuge (Jimmy) Shiyugeten.github.io
- [2507.19457] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learningarxiv.org
- How can LLM RL Work Despite Information-Theoretic Inefficiencyberen.io
- Interactive Visualization of RL Algorithms for LLM Trainingzcy233035.github.io
- GRPO++: Tricks for Making RL Actually Workcameronrwolfe.substack.com
- GenAI Handbookgenai-handbook.github.io
- RLHF: Reinforcement Learning from Human Feedbackhuyenchip.com
- Patterns for Building LLM-based Systems & Productseugeneyan.com
- The upcoming GPT-3 moment for RL | Mechanize, Inc.mechanize.work
- LLM Resourcesforrestbicker.com