PulseAugur
EN
LIVE 10:00:20

New method enables voice cloning in text-to-audio-video models

Researchers have developed a method to add voice cloning capabilities to text-to-audio-video (T2AV) generation models. By incorporating a single, zero-initialized linear layer and fine-tuning, T2AV models can be adapted to clone voices from short reference recordings. This approach significantly outperforms existing voice-cloning text-to-speech baselines in speaker-encoder cosine similarity. AI

IMPACT Enables more personalized and realistic audio-visual content generation by allowing custom voice integration.

RANK_REASON The cluster contains an academic paper detailing a new method for voice cloning in AI models. [lever_c_demoted from research: ic=1 ai=1.0]

Read on arXiv cs.AI →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

New method enables voice cloning in text-to-audio-video models

COVERAGE [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov ·

    Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

    arXiv:2608.15690v1 Announce Type: cross Abstract: Text-to-audio-video (T2AV) generation models produce a video and its soundtrack from a textual description, but offer no control over whose voice speaks in the output. We show that a base T2AV model can be turned into a voice-clon…