Unified Diffusion Audio Improves Structured Scene Control
A DiT conditioned on structured temporal records generates 48 kHz stereo mixtures through 25 Hz VAE latents, raising rich-timeline mIoU to 43.73 from 38.48.
Aug 1, 20265 min2607.27011
1 article on SOTA Papers