Han Zhao

4 articles on SOTA Papers

Full-Context Rendering Reduces Music Codec Exposure Bias

FullDiT conditions a diffusion transformer on imperfect eight-stream codec plans, lyrics, and captions, improving ViSQOL by 0.77 under synthetic corruption.

Aug 12, 20264 min2608.08787

Unified Diffusion Audio Improves Structured Scene Control

A DiT conditioned on structured temporal records generates 48 kHz stereo mixtures through 25 Hz VAE latents, raising rich-timeline mIoU to 43.73 from 38.48.

Aug 1, 20265 min2607.27011

Low-Rate Tokens Improve Controllable Speech Synthesis

Qwen-Audio-3.0-TTS couples a 12.5 Hz tokenizer with staged LM–FM training, supporting 16 languages and one-pass 3-minute generation.

Jul 28, 20265 min2607.23938

Xiaomi Scales Robot Policies With Real Trajectories

A two-stage VLA recipe combines 100K hours of UMI trajectories with cross-embodiment post-training, reaching 57.4% on RoboCasa365.

Jul 28, 20265 min2607.15330