实体
Audio and Speech Processing
Audio and Speech Processing
PulseAugur coverage of Audio and Speech Processing — every cluster mentioning Audio and Speech Processing across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的多智能体系统提高了听觉场景分析的速度和鲁棒性
研究人员开发了一种新的多智能体系统,用于听觉场景分析(ASA),该系统显著提高了定位速度和鲁棒性。该系统将ASA建模为多个智能体,每个智能体负责定位、分离和分类声源等特定任务,并将结果进行通信以优化性能。关键创新是一种新的优化机制,它使用一系列位置的质量估计集,提供更清晰的搜索空间,并与依赖单一、可变质量估计的先前方法相比,减少了优化时间。
-
新框架审计语音AI客服中的偏见和安全问题
一篇新的研究论文介绍了一个用于审计用于客户服务的语音AI系统中的偏见和安全问题的框架。所提出的方法对语音AI架构进行了分类,包括级联的ASR到语言模型到TTS以及工具驱动的系统。它强调在受控的呼叫者呈现条件下(如口音和情感)验证系统行为,以识别超越简单语音识别差异的潜在危害。
-
VoiceDesigner框架实现多样化的文本到语音生成和编辑
研究人员推出VoiceDesigner,一个用于文本到语音生成和编辑的新框架,旨在解决当前系统的局限性。该系统旨在生成更多样化的声音,包括虚构角色,并提供增强的编辑功能,如语音克隆和属性修改。VoiceDesigner利用混合数据管道和具有架构改进的扩散Transformer,以实现更好的提示对齐和感知质量。