PulseAugur
实时 09:25:18
English(EN) Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

新的离散扩散模型增强了语音修复和编辑能力

研究人员开发了SIEDD,一种新颖的离散扩散模型,用于语音修复和编辑。该框架名为HiCoDD,在分层编解码器令牌上运行,在保持说话人身份、韵律和录音条件的同时,迭代地优化掩码片段。SIEDD在RealEdit语音编辑基准测试中表现出卓越的性能,并在语音修复任务中优于自回归基线,展示了显式建模编解码器层级以实现上下文保留音频重建的好处。 AI

影响 该模型可以通过实现更精确的语音片段重建和修改,从而改进音频编辑工具和内容创作。

排序理由 该集群包含一篇详细介绍新模型及其在基准测试中性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的离散扩散模型增强了语音修复和编辑能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Iftach Shoham, Tali Dror, Oren Gal, Haim Permuter, Gilad Katz, Eliya Nachmani ·

    用于文本引导语音修复和编辑的多编解码离散扩散模型

    arXiv:2608.06424v1 Announce Type: cross Abstract: Speech recordings often contain missing, corrupted, or incorrect regions that must be reconstructed or modified without re-synthesizing the entire utterance. Speech inpainting restores missing segments, whereas speech editing repl…