Jingbei Li

1 article on SOTA Papers

Unified Diffusion Audio Improves Structured Scene Control

A DiT conditioned on structured temporal records generates 48 kHz stereo mixtures through 25 Hz VAE latents, raising rich-timeline mIoU to 43.73 from 38.48.

Aug 1, 20265 min2607.27011