PulseAugur
中
实时 22:53:22
实体 HTDemucs

HTDemucs

PulseAugur coverage of HTDemucs — every cluster mentioning HTDemucs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_288016 ·

    audio.cpp 提升 Higgs Audio TTS、HTDemucs 和 PocketTTS 的性能

    audio.cpp 项目发布了对各种音频模型的显著性能增强。Higgs Audio TTS 现在需要减少 48% 的显存占用,运行在 6GB 以下,而 HTDemucs 在 GPU 上速度提升 2.2 倍,PocketTTS 在 CPU 上速度提升 2.2 倍。这些运行时优化旨在使现有音频模型在不影响质量的情况下更适合本地使用。该项目还为其 WebUI 引入了一个实验性的生成历史记录功能,并继续扩展对各种音频模型的支持。

  2. TOOL · CL_140964 ·

    Meta 的 Demucs 模型已转化为生产级音频分离 API

    本文详细介绍了如何将 Meta 的 Demucs 音频分离模型转化为生产级 API。通过概述具有命令行界面 (CLI)、FastAPI 服务器和 Docker 容器的服务开发,解决了在实际环境中使用研究代码的挑战。该方法侧重于实际实现,包括标准化输出格式和强大的错误处理,以使 Demucs 的高级音频分离功能可用于播客清理和内容本地化等应用。

  3. TOOL · CL_119337 ·

    audio.cpp 通过 C++/GGML 添加音乐、SFX 和长篇 TTS 模型

    audio.cpp 项目发布了重大更新,引入了对 ACE-Step、Stable Audio、HeartMuLa、RoFormer 和 HTDemucs 等新音频模型的原生 C++/GGML 支持。此次扩展支持音乐和 SFX 生成以及声源分离,其中一些模型现在能够生成长达10分钟的音频。此外,还集成了 VibeVoice 1.5B,在长篇 TTS 方面表现出色,在 RTX 5090 上不到23分钟即可生成90分钟的音频,显著优于基于 …