Emilien Fugier

1 article on SOTA Papers

Monocular Navigation Surpasses Depth-Based Systems on R2R-CE

An 8B vision-language model predicts image-space waypoints from a single RGB stream, reaching 77.4% unseen-environment success while cutting supervised training tokens 22×.

Aug 5, 20264 min2607.20785