PulseAugur
实时 21:14:14
实体 VoxCPM2

VoxCPM2

PulseAugur coverage of VoxCPM2 — every cluster mentioning VoxCPM2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_147486 ·

    WanSong模型使用扩散模型生成带双音轨的5分钟歌曲

    研究人员推出WanSong,这是一种新颖的基于扩散的模型,旨在生成长篇、商业级歌曲。该模型直接生成长达五分钟的高保真、多语言歌曲,并在一次运行中输出人声和背景音乐。WanSong的扩散框架还通过步进蒸馏加速推理,并为编辑任务的微调和定制提供了简化的流程。

  2. RESEARCH · CL_131322 ·

    新的TTS系统BlueMagpie-TTS面向台湾普通话语码转换

    研究人员开发了BlueMagpie-TTS,一个专门针对台湾普通话和语码转换语音的新型文本到语音系统。该系统引入了PangolinTokenizer,一种针对台湾数据优化的字节级分词器,实现了比现有方法更低的分词率。它还配备了Barbet,一个在此分词器上训练的大型语言模型,在繁体中文语义理解方面表现出色。通过将Barbet与VoxCPM2的固定声学模型集成,BlueMagpie-TTS显著降低了字符和单词错误率,并在盲听研究中展示了卓越的性能。

  3. TOOL · CL_111184 ·

    audio.cpp 框架提供更快的音频模型推理速度

    一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。

  4. RESEARCH · CL_111604 ·

    LoRA 微调提升了低资源高棉语 TTS 的质量

    研究人员开发了一种方法来提高高棉语和韩语等低资源语言的文本到语音(TTS)质量。通过使用单个低秩自适应(LoRA)适配器微调 2.4B 参数的 VoxCPM2 模型,他们将高棉语的平均意见得分(MOS)从 3.85 显著提高到 4.23。这种适配器仅训练了模型参数的一小部分,证明了其效率。该技术对于基础模型最初表现不佳的语言效果最好,而对于基础模型已经处理得很好的韩语,则没有显示出任何好处,甚至出现了性能下降。

  5. TOOL · CL_61575 ·

    Rust RAG、无分词器TTS和离线AI生存计算机

    该集群重点介绍了本地和离线AI部署的进展。它包含一个关于使用Rust构建高性能检索增强生成(RAG)系统的指南,强调了自托管应用程序的性能和控制。此外,它还介绍了OpenBMB的VoxCPM2,一个新颖的、无分词器的多语言文本到语音模型,能够进行逼真的语音克隆;以及Project N.O.M.A.D.,一个用于独立、离线AI生存计算机的开源项目。