Professional GUI Agents Stall on Long-Horizon Workflows
Workflow-GYM evaluates 338 tasks across 56 virtual-machine software environments, where the best model averages 30.67% success.
Jul 28, 20265 min2606.11042
2 articles on SOTA Papers
Workflow-GYM evaluates 338 tasks across 56 virtual-machine software environments, where the best model averages 30.67% success.
Next-State-Prediction trains a shared latent space from video, events, and VQA data, improving balanced downstream readouts with a frozen backbone.