Tianfeng Long

2 articles on SOTA Papers

Professional GUI Agents Stall on Long-Horizon Workflows

Workflow-GYM evaluates 338 tasks across 56 virtual-machine software environments, where the best model averages 30.67% success.

Jul 28, 20265 min2606.11042

Orca Unifies World Modeling Across Text, Vision, and Action

Next-State-Prediction trains a shared latent space from video, events, and VQA data, improving balanced downstream readouts with a frozen backbone.

Jul 28, 20265 min2606.30534