MMAudio
PulseAugur coverage of MMAudio — every cluster mentioning MMAudio across labs, papers, and developer communities, ranked by signal.
-
New KVAE tokenizers aim to advance multimodal generative models
Researchers have introduced a new family of tokenizers called KVAE, designed for multimodal generative models. These tokenizers, including KVAE-Audio, KVAE-3D, and KVAE-2D, are specifically engineered for text-condition…
-
kandinskylab releases KVAE-Audio, a high-fidelity audio autoencoder
KVAE-Audio, a new continuous, full-band audio autoencoder, has been released by kandinskylab. This model effectively compresses raw audio waveforms into compact latents and reconstructs them with high fidelity across sp…
-
Open-source workflow generates 'Pirate Movie' beta trailer
A beta trailer for a "Pirate Movie" has been released, showcasing a workflow for generating movie trailers using a fully open-source stack. The project leverages SDXL for base images, Qwen Image Edit for adjustments, LT…
-
MMAudioReverbs uses video to improve audio dereverberation and RIR estimation
Researchers have developed MMAudioReverbs, a novel framework that leverages pre-trained video-to-audio (V2A) models for acoustic processing tasks. This approach allows for dereverberation and room impulse response estim…