Monocular Navigation Surpasses Depth-Based Systems on R2R-CE
An 8B vision-language model predicts image-space waypoints from a single RGB stream, reaching 77.4% unseen-environment success while cutting supervised training tokens 22×.
Aug 5, 20264 min2607.20785