LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion
The model jointly denoises action chunks and future DINO sequences within a unified multi-modal diffusion transformer framework. Heterogeneous data play distinct yet complementary roles for learning visual forecasting, dynamics learning and policy.
LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion Paper Code Data (Coming Soon) Checkpoints LDA-1B is a dynamics-centric robot foundation model trained on 30k+ hours of heterogeneous embodied data . It jointly learns dynamics , visual forecasting , and policy in a unified latent space , enabling scalable learning beyond BC. Universal Embodied Data Ingestion Unified Latent Dynamics and Policy Learning The model jointly denoises action chunks and future DINO sequences within a unified multi-modal diffusion transformer framework. Heterogeneous data play distinct y
Explore this link on the map →saved by
related reading
- [2602.12215] LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestionarxiv.org
- [2410.11758] Latent Action Pretraining from Videosarxiv.org
- Generalist - GEN-0 / Embodied Foundation Models That Scale with Physical Interactiongeneralistai.com
- The First Fully General Computer Action Model | blogsi.inc
- 45d74e190008c7bff2845ffc8e3facd3-Paper-Conference.pdfproceedings.iclr.cc
- e5b5c402bb7bd5e60bede6961d6fe39e-Paper-Conference.pdfproceedings.iclr.cc
- State of Robot Learning, December 2025vedder.io
- Causal Video Models Are Data-Efficient Robot Policy Learners | Rhoda AIrhoda.ai
- A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulationtoyotaresearchinstitute.github.io
- EgoScaleresearch.nvidia.com
- Open X-Embodiment: Robotic Learning Datasets and RT-X Modelsarxiv.org
- Emergence of Human to Robot Transfer in Vision-Language-Action Modelspi.website