F5-TTS
PulseAugur coverage of F5-TTS — every cluster mentioning F5-TTS across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新攻击揭示微调语音合成模型存在严重隐私风险
研究人员开发了一个新的黑盒成员推理攻击(MIA)框架,专门针对微调的文本到语音(TTS)模型。该框架解决了TTS系统固有的查询生成和表示工程方面的挑战。在三个最先进的TTS模型上进行的评估表明,存在显著的隐私泄露,在困难场景下,说话人级别的AUC得分高达1.0,记录级别的AUC得分在0.80到0.90之间。
-
新的TTS流水线通过基于音素的增强功能改进ASR系统
研究人员开发了一个统一的流水线,用于生成合成语音以改进自动语音识别(ASR)系统。该流水线使用多语言文本到语音(TTS)模型F5-TTS,并带有语言ID条件。一种名为音素频率引导选择(PFGS)的新颖方法根据音素频率对候选句子进行排名,在阿拉伯语、法语、意大利语和葡萄牙语的实验中,其表现优于随机选择和仅真实数据训练。
-
作者详述了微调 F5-TTS 模型时遇到的五个常见陷阱
作者详细介绍了在为新书写系统微调 F5-TTS 文本转语音模型时犯的五个关键错误。这些错误主要与加载正确的模型权重和验证词汇更改有关,导致了大量的 GPU 时间浪费。作者强调了严格测量和交叉验证的重要性,例如通过比较词汇文件和断言张量匹配,以避免此类陷阱。
-
俄罗斯AI语音合成面临质量、成本和许可障碍
使用AI生成逼真的俄语人声面临重大挑战,因为不同模型对同一文本表现出不同程度的性能。虽然一些服务在发音和重音方面存在困难,但其他服务则提供更自然的输出,尽管成本更高或访问受限。开源模型提供了免费替代方案,但许可可能成为商业使用的障碍,只有少数选项可在宽松许可下使用。
-
语音合成评估受自动语音识别家族对齐干扰,提出新的集成方法
研究人员发现,在使用自动语音识别(ASR)验证器评估文本到语音(TTS)系统时存在一个重大的混淆因素。这些验证器的表面质量很大程度上受用于判断的ASR家族影响,导致排名颠倒和性能指标虚高。为解决此问题,该论文提出跨家族排名集成方法,该方法可实现更低的词错误率,并在其他指标上保持性能,建议进行跨评估器三角测量以获得稳健的报告。
-
新模型统一语音和歌声生成
研究人员开发了新的统一模型,用于生成人类语音音频,能够同时生成语音和歌声。UniVoice 使用条件流匹配方法,分离内容、旋律和音色,从而能够独立控制语音韵律和歌唱旋律。UniSinger 基于多模态扩散 Transformer 构建,统一了说话人克隆歌曲生成与带伴奏的歌声转换。这两个模型在各自的任务上都展现了最先进的性能,为音频生成和音乐制作带来了新的可能性。