RoboTTT: Context Scaling for Robot Policies
RoboTTT integrates Test-Time Training into robot foundation models, scaling visuomotor context to 8K timesteps — three orders of magnitude beyond state-of-the-art policies — without growing inference latency.
Yunfan Jiang1,2, Yevgen Chebotar1, Ruijie Zheng1, Fengyuan Hu1, Yunhao Ge1, Jimmy Wu1, Tianyuan Dai1,3, Scott Reed1, Li Fei-Fei2,†, Yuke Zhu1,3,†, Linxi “Jim” Fan1,† 1NVIDIA2Stanford University3The University of Texas at Austin†Equal advising arXivPaper Abstract Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At…
saved by
related reading
- [2607.15275] RoboTTT: Context Scaling for Robot Policiesarxiv.org
- GEN-1.5: Embodied Foundation Models are One-Shot Learners - Generalist AIgeneralistai.com
- Causal Video Models Are Data-Efficient Robot Policy Learners | Rhoda AIrhoda.ai
- How Claude Performs on Robotics Tasks \ Anthropicanthropic.com
- Emergence of Human to Robot Transfer in Vision-Language-Action Modelspi.website
- Introducing S1: In-Context Learning for Roboticsskild.ai
- State of Robot Learning, December 2025vedder.io
- A Steerable Model with Emergent Capabilitiespi.website
- Generalist - GEN-0 / Embodied Foundation Models That Scale with Physical Interactiongeneralistai.com
- ACT-1: A Robot Foundation Model Trained on Zero Robot Data | Sunday Robotics | The helpful robotics companysunday.ai
- Explore | alphaXivalphaxiv.org
- e5b5c402bb7bd5e60bede6961d6fe39e-Paper-Conference.pdfproceedings.iclr.cc