Haoxu Wang

1 article on SOTA Papers

Low-Rate Tokens Improve Controllable Speech Synthesis

Qwen-Audio-3.0-TTS couples a 12.5 Hz tokenizer with staged LM–FM training, supporting 16 languages and one-pass 3-minute generation.

Jul 28, 20265 min2607.23938