研究人员推出 BabelFake,这是一个新的多语言音视频深度伪造基准,旨在解决现有数据集的局限性。BabelFake 包含来自 496 名个体、跨越五种语言(英语、德语、意大利语、法语和西班牙语)的 1,323 小时视频素材。该基准利用一个模块化流程,结合了现代视频操纵技术和语音克隆引擎,区分了仅视觉操纵和联合音视频操纵。评估表明,检测难度因生成方法而异,并且在保留真实音频时性能会显著下降。此外,人类对真实性的感知并不总是与机器检测难度一致。 AI
影响 该基准可以提高深度伪造检测模型在各种语言和操纵技术上的鲁棒性。
排序理由 该条目描述了一个用于音视频深度伪造检测的新基准数据集,发布在 arXiv 上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →