Heinrich Dinkel

1 article on SOTA Papers

End-to-End Audio Generation Cuts Speech Errors

An LLM predicts audio latents autoregressively while per-token flow matching generates variable-length scenes, reducing English Seed-TTS WER from 12.15% to 2.79%.

Aug 25, 20264 min2608.11804 Code available