Variants of Dynamic Programming | Chan`s Jupyter
goodboychan.github.io · 379 words · saved by 1 readers
A summary of “Understanding deep reinforcement learning”
Policy Improvement by Iterative Methods Asynchronous Dynamic Programming In-Place Dynamic Programming Prioritized Sweeping Sample Backups Approximate DP Policy Improvement by Iterative Methods Asynchronous Dynamic Programming Dynamic Programming mentioned before used synchronous backups which updates all staes at each iteration in parallel. (that means, next state value function can be calculated when the current state value function is ready.) Asynchronous DP updates each state in any order. This can significantly reduce computation, and it is convergent if all states continue to…
saved by
related reading
- A (Long) Peek into Reinforcement Learning | Lil'Loglilianweng.github.io
- Policy Gradient Algorithms | Lil'Loglilianweng.github.io
- 4.4 Value Iterationincompleteideas.net
- RLAlgsInMDPs.pdfsites.ualberta.ca
- An Updated Introduction to Reinforcement Learning | Sri's Blogsrianumakonda.com
- The 37 Implementation Details of Proximal Policy Optimization · The ICLR Blog Trackiclr-blog-track.github.io
- RL_Notes__final_.pdfjubayer-ibn-hamid.github.io
- rltheorybook_ABJKS.pdfrltheorybook.github.io
- Reinforcement Learning in Newcomblike Problemsproceedings.neurips.cc
- Deep RL Bootcamp - Lecturessites.google.com
- NeurIPS-2021-understanding-end-to-end-model-based-reinforcement-learning-methods-as-implicit-parameterization-Supplemental.pdflis.csail.mit.edu
- RUDDER - Reinforcement Learning with Delayed Rewards | rudderml-jku.github.io