AudioSeal
PulseAugur coverage of AudioSeal — every cluster mentioning AudioSeal across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的AudioNoisePrints方法实现了TTS音频的无模型水印
研究人员开发了AudioNoisePrints,一种用于文本到语音(TTS)模型生成音频的水印新方法。该技术利用流匹配和扩散模型中初始噪声输入与生成音频之间的空间相关性,无需重新训练TTS模型或损害音频质量即可实现水印。与AudioSeal等现有基线相比,该方法在激进的增强条件下表现出优越的性能,并有望在各种TTS和声码器模型中得到更广泛的应用。
-
音频深度伪造检测面临来源标记的新挑战 · 已追踪 2 个来源
两篇新的研究论文探讨了检测音频深度伪造所面临的挑战,特别是在涉及来源标记时。第一篇论文 MADBench 引入了一个区分合成语音和环境音频的基准,揭示了环境音频操纵更易于检测,但当前的检测器在这两方面都失败了。第二篇论文《水印捷径》展示了如何为合成语音添加水印会无意中为检测器创造一个“捷径”,导致性能下降和对真实音频产生误报。这项研究强调了需要更鲁棒的检测方法来考虑不同的音频组件和来源信息。
-
研究发现水印捷径导致音频深度伪造检测存在缺陷
一篇新论文《水印捷径》(The Watermark Shortcut)揭示了依赖水印的音频深度伪造检测系统存在一个关键缺陷。当合成语音被添加水印而真实语音没有时,检测器会错误地将水印标记为伪造声音的指示符。这会导致性能下降,使带水印的伪造语音在去除水印后能够逃避检测,以及将真实语音错误地归类为伪造。研究人员在白盒和黑盒实验中都展示了这个问题,包括使用一个商业API,并发布了一个名为WASP的数据集以协助进一步研究。
-
OmniVoice Studio 作为本地开源语音 AI 替代方案发布
OmniVoice Studio 是一款新的开源桌面应用程序,旨在成为 ElevenLabs 等云服务的本地替代方案。它提供一套由 AI 驱动的音频工具,包括从 3 秒剪辑进行语音克隆、语音设计、视频配音、实时听写和说话人分离,所有这些都在用户的机器上进行处理。该应用程序支持超过 600 种语言的文本转语音和 99 种语言的转录,利用各种 ML 库,并通过多个 TTS 引擎集成提供灵活性。
-
新的XAttnMark系统改进了音频水印,以对抗AI生成的内容
研究人员开发了XAttnMark,一种新颖的音频水印系统,旨在打击生成式AI的版权侵权和虚假信息。该系统利用交叉注意力机制和时间条件来提高水印检测的鲁棒性和归属的准确性。XAttnMark还包含一个与心理声学对齐的损失函数,以增强水印的不可感知性,并在各种音频转换和生成编辑方面展示了最先进的性能。