PulseAugur
实时 21:11:05
English(EN) Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection

新的基于DiT的方法增强了跨域音频深度伪造检测能力

研究人员开发了一种新颖的跨域音频深度伪造检测方法,使用扩散Transformer (DiT) 作为重建探针。该方法利用DiT生成的多比率残差图,这些残差图对域变化敏感。通过将这些残差与来自WavLM的投影听觉表示融合,该系统旨在提高跨不同生成器、语料库和录音条件的检测准确性。初步结果在ASVspoof 5 Eval和ITW Full等基准数据集上显示出有希望的性能,在某些设置下优于参考的WavLM-ResNet18模型。 AI

影响 这项研究可能带来更强大的音频深度伪造检测系统,能够处理多样化和未见过的数据变化。

排序理由 该集群包含一篇详细介绍音频深度伪造检测新方法的学术论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的基于DiT的方法增强了跨域音频深度伪造检测能力

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Haotian Mo, Jie Liu, Siqi Shen, Songzhu Mei, Xinhai Chen, Xiangyang Wang, Yigui Feng, Shuai Li, Gencheng Liu, Keqi Yang, Qinglin Wang ·

    用于跨域音频深度伪造检测的音频锚定多比率DiT重建残差融合

    arXiv:2607.26472v1 Announce Type: cross Abstract: Audio deepfake detectors often degrade when generators, corpora, or recording conditions change. We use a Diffusion Transformer (DiT), trained only on bona fide speech, as a frozen reconstruction probe. Reconstructions at masking …

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    用于跨域音频深度伪造检测的音频锚定多比率DiT重建残差融合

    Audio deepfake detectors often degrade when generators, corpora, or recording conditions change. We use a Diffusion Transformer (DiT), trained only on bona fide speech, as a frozen reconstruction probe. Reconstructions at masking ratios 0.5, 0.75, and 0.9 yield explicit multi-rat…