2106.01345
arxiv.org · 7,715 words · saved by 1 readers
N/A
Decision Transformer: Reinforcement Learning via Sequence Modeling Lili Chen∗,1 , Kevin Lu∗,1 , Aravind Rajeswaran2 , Kimin Lee1 , Aditya Grover2 , Michael Laskin1 , Pieter Abbeel1 , Aravind Srinivas†,1 , Igor Mordatch†,3 ∗ equal contribution † equal advising arXiv:2106.01345v2 [cs.LG] 24 Jun…
saved by
related reading
- Reframing Reinforcement Learning as Sequence Modeling with Transformers?danieltakeshi.github.io
- Online Decision Transformerarxiv.org
- Efficient World Models with Context-Aware Tokenizationarxiv.org
- State of RL for reasoning LLMs | A. Weersaweers.de
- Ch. 21 - Imitation Learningunderactuated.mit.edu
- Getting Caught Up to Modern LLM Research | Samarth Goeldev.samarthgoel.com
- RUDDER - Reinforcement Learning with Delayed Rewards | rudderml-jku.github.io
- Transformer (deep learning) - Wikipediaen.wikipedia.org
- [2412.14135] Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspectivearxiv.org
- RLHF | John Lambertjohnwlambert.github.io
- Introducing Dreamer: Scalable Reinforcement Learning Using World Modelsresearch.google
- Large Language Models Reading List | Sebastian Raschka, PhDsebastianraschka.com