CosyVoice2
PulseAugur coverage of CosyVoice2 — every cluster mentioning CosyVoice2 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的X2-NativeCursor系统改进了文本到语音的进度跟踪
研究人员开发了X2-NativeCursor,一种用于增量文本到语音(TTS)应用程序中跟踪文本进度的创新系统。这个轻量级观察器通过在波形解码前分析原生语音Token来运行,从而实现更精确的同步,用于高亮显示和中断处理等功能。与现有的基于波形的方法相比,该系统在跟踪误差和实时性能方面均有显著改善,并在Qwen3-TTS和CosyVoice2等模型上得到了验证。
-
新攻击揭示微调语音合成模型存在严重隐私风险
研究人员开发了一个新的黑盒成员推理攻击(MIA)框架,专门针对微调的文本到语音(TTS)模型。该框架解决了TTS系统固有的查询生成和表示工程方面的挑战。在三个最先进的TTS模型上进行的评估表明,存在显著的隐私泄露,在困难场景下,说话人级别的AUC得分高达1.0,记录级别的AUC得分在0.80到0.90之间。
-
NouveauVoice框架通过多样化的伪造说话人增强语音匿名效果
研究人员开发了NouveauVoice,一个旨在为语音匿名生成多样化伪造说话人的新框架。该系统利用分层深度变分自编码器(NVAE),并可与FACodec和CosyVoice2等现有架构集成。评估表明,NouveauVoice显著增强了说话人多样性和身份隐藏性,在面对说话人验证攻击时,等错误率(EER)超过38%,同时保持了匿名性、多样性和语音可用性之间的平衡。
-
新的TTS方法将情感控制准确率提高了12%
研究人员开发了一种名为跨模态一致性引导无分类器引导(CCG-CFG)的新方法,以改进自回归文本到语音(TTS)模型中的情感控制。该技术根据文本情感和期望语音情感之间的冲突动态调整引导尺度,从而增强情感一致性。当应用于CosyVoice2模型时,这种方法在情感识别准确率和主观质量得分方面取得了显著改进,优于HierSpeech++和Qwen3-TTS等现有方法。
-
消费级显卡也能快速上手!面壁智能MiniCPM-o 4.5发布技术报告
MiniCPM-o 4.5 是一个全新的 9B 参数的全模态大语言模型,专为实时、全双工交互而设计。它可以同时处理和生成音频、视频和文本,实现主动行为和持续的环境理解。该模型利用 Omni-Flow 框架进行时间对齐处理,并针对高效推理进行了优化,使其能够在内存小于 12GB 的边缘设备上运行。