Open Egocentric Data Lowers Barriers for Robot Learning
Smartphone capture and a modular processing toolchain turn 2,000 hours of human manipulation video into structured supervision for embodied models.
Jul 29, 20265 min2607.14183
2 articles on SOTA Papers
Smartphone capture and a modular processing toolchain turn 2,000 hours of human manipulation video into structured supervision for embodied models.
Next-State-Prediction trains a shared latent space from video, events, and VQA data, improving balanced downstream readouts with a frozen backbone.