audio.cpp 项目发布了 0.5 版本,引入了多个新的 AI 模型和改进的硬件支持。主要新增功能包括 DramaBox,一个能够控制情感和语气的表达型 TTS 模型;以及 Confucius4,支持跨语言语音转换。该版本还包括用于语音转换的 RVC、用于人声分离的 BS-RoFormer,并集成了 GLM-TTS、Kroko ASR、Parakeet-TDT、Inflect Micro v2 和 Fun-ASR-Nano 等模型。性能改进包括 Apple Silicon 上更快的 Metal 支持和对 AMD GPU 的早期 ROCm/HIP 支持,以及对实时 PCM ingest 和流式 transcript deltas 的改进。 AI
影响 通过新增的表达型和跨语言语音模型,扩展了开源音频处理工具的功能。
排序理由 发布了一个开源音频处理项目的新版本,包含新模型和硬件支持。
- Apple Silicon
- audio.cpp
- BS-RoFormer
- Confucius4
- DramaBox
- FunASR
- Fun-ASR-Nano
- GLM-TTS
- Inflect Micro v2
- Kroko ASR
- Parakeet-TDT
- ROCm
- StableDiffusion
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →