audio.cpp
PulseAugur coverage of audio.cpp — every cluster mentioning audio.cpp across labs, papers, and developer communities, ranked by signal.
- 2026-08-01 product_launch audio.cpp released version 0.5 with new TTS and voice transfer models, alongside platform enhancements. 来源
- 2026-07-01 product_launch The author of audio.cpp has added support for VibeVoice 1.5B, enabling faster local text-to-speech generation. 来源
- 2026-07-01 product_launch The audio.cpp project released new audio models and features, including music generation, SFX generation, source separation, and long-form TTS. 来源
2 天有情绪数据
-
audio.cpp 0.5 增加了 DramaBox TTS、Confucius4 语音转换和 AMD GPU 支持
audio.cpp 项目已发布 0.5 版本,对其文本转语音 (TTS) 和语音转换功能进行了重大更新。一个主要亮点是 DramaBox,一个专为提示词驱动的配音设计的新模型,可控制情感和表达。该版本还推出了 Confucius4-TTS 用于跨语言语音转换,并集成了其他几个模型和 ASR 系统。平台支持的增强功能包括对 AMD GPU 的早期 HIP/ROCm 兼容性以及对 Apple Silicon 的性能改进,同时还改进了直播和摄入功能。
-
audio.cpp 0.4 增加 TTS/ASR 模型,支持完整 GGUF
audio.cpp 项目已发布 0.4 版本,引入了对多种新的高质量文本转语音 (TTS) 和自动语音识别 (ASR) 模型支持,包括 Higgs Audio v3 TTS 4B 和 Fish Audio S2 Pro。此版本还全面集成了 GGUF 格式支持所有模型家族,提供了显著的速度和 VRAM 提升,尤其是在 Q8 量化方面。该项目现支持 35 个模型家族,并新增了社区模型区域以支持更成熟的移植。
-
audio.cpp 通过 C++/GGML 添加音乐、SFX 和长篇 TTS 模型
audio.cpp 项目发布了重大更新,引入了对 ACE-Step、Stable Audio、HeartMuLa、RoFormer 和 HTDemucs 等新音频模型的原生 C++/GGML 支持。此次扩展支持音乐和 SFX 生成以及声源分离,其中一些模型现在能够生成长达10分钟的音频。此外,还集成了 VibeVoice 1.5B,在长篇 TTS 方面表现出色,在 RTX 5090 上不到23分钟即可生成90分钟的音频,显著优于基于 …
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。