End-to-End Audio Generation Cuts Speech Errors
An LLM predicts audio latents autoregressively while per-token flow matching generates variable-length scenes, reducing English Seed-TTS WER from 12.15% to 2.79%.
Aug 25, 20264 min2608.11804 Code available