实体
CosyVoice2
CosyVoice2
PulseAugur coverage of CosyVoice2 — every cluster mentioning CosyVoice2 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
NouveauVoice框架通过多样化的伪造说话人增强语音匿名效果
研究人员开发了NouveauVoice,一个旨在为语音匿名生成多样化伪造说话人的新框架。该系统利用分层深度变分自编码器(NVAE),并可与FACodec和CosyVoice2等现有架构集成。评估表明,NouveauVoice显著增强了说话人多样性和身份隐藏性,在面对说话人验证攻击时,等错误率(EER)超过38%,同时保持了匿名性、多样性和语音可用性之间的平衡。
-
新的TTS方法将情感控制准确率提高了12%
研究人员开发了一种名为跨模态一致性引导无分类器引导(CCG-CFG)的新方法,以改进自回归文本到语音(TTS)模型中的情感控制。该技术根据文本情感和期望语音情感之间的冲突动态调整引导尺度,从而增强情感一致性。当应用于CosyVoice2模型时,这种方法在情感识别准确率和主观质量得分方面取得了显著改进,优于HierSpeech++和Qwen3-TTS等现有方法。
-
消费级显卡也能快速上手!面壁智能MiniCPM-o 4.5发布技术报告
MiniCPM-o 4.5 是一个全新的 9B 参数的全模态大语言模型,专为实时、全双工交互而设计。它可以同时处理和生成音频、视频和文本,实现主动行为和持续的环境理解。该模型利用 Omni-Flow 框架进行时间对齐处理,并针对高效推理进行了优化,使其能够在内存小于 12GB 的边缘设备上运行。