Parakeet-TDT
PulseAugur coverage of Parakeet-TDT — every cluster mentioning Parakeet-TDT across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
audio.cpp 0.5 增加了 DramaBox TTS、Confucius4 语音转换和 AMD GPU 支持
audio.cpp 项目已发布 0.5 版本,对其文本转语音 (TTS) 和语音转换功能进行了重大更新。一个主要亮点是 DramaBox,一个专为提示词驱动的配音设计的新模型,可控制情感和表达。该版本还推出了 Confucius4-TTS 用于跨语言语音转换,并集成了其他几个模型和 ASR 系统。平台支持的增强功能包括对 AMD GPU 的早期 HIP/ROCm 兼容性以及对 Apple Silicon 的性能改进,同时还改进了直播和摄入功能。
-
新的Earnings25基准测试评估金融财报电话会议的ASR性能
研究人员推出了Earnings25,这是一个旨在评估自动语音识别(ASR)系统在金融财报电话会议中性能的新基准测试。该基准测试包含近500小时的2025年第四季度标普500公司财报电话会议的庞大数据集,以及代表不同行业的46小时分段数据集。Earnings25提供了对齐的转录文本和元数据,如说话者角色和行业标签,以便进行超越简单词错误率的更细致评估。
-
新的Earnings25基准测试评估金融电话的ASR性能
研究人员推出了Earnings25,这是一个新的基准测试,旨在专门评估金融财报电话的自动语音识别(ASR)系统。该基准测试包含两个数据集:一个包含2025年第四季度标普500公司财报电话的498小时完整数据集,以及一个包含2025年美国财报电话的46小时分割数据集。Earnings25提供了对齐的文本记录和元数据,如说话人角色和行业标签,从而能够进行超越简单词错误率的更细致的评估。
-
Hugging Face 实现 Reachy Mini 的完全本地化对话
Hugging Face 发布了一份指南,详细介绍了如何为 Reachy Mini 机器人设置完全本地化的语音到语音对话流程。该设置采用级联方法,并推荐使用 llama.cpp 作为 LLM,Gemma 4、Silero VAD、Parakeet-TDT 进行语音转文本,以及 Qwen3-TTS 进行文本转语音。该系统优先考虑隐私,消除了 API 成本,并提供对流程的完全控制,允许用户在有新模型可用时进行组件替换。