PulseAugur
中
实时 11:39:30
实体 Nityanand Mathur

Nityanand Mathur

PulseAugur coverage of Nityanand Mathur — every cluster mentioning Nityanand Mathur across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_280119 ·

    新研究表明 TTS 模型深度和精炼应分开优化

    一篇新研究论文探讨了掩码扩散文本到语音(TTS)模型中模型深度和精炼步骤之间的权衡。研究发现,虽然精炼步骤显著提高了可懂度,但与增加模型深度相比,它们在保留说话人身份方面效果较差。研究表明,这两个计算方面针对的是不同的瓶颈,应分开优化,此外还有研究发现,TTS 系统的编解码器组件在剩余的身份缺失方面起着至关重要的作用。

  2. TOOL · CL_180446 ·

    DLLM-TTS框架实现更快、更准确的文本到语音合成

    研究人员推出了一种新颖的文本到语音合成框架DLLM-TTS,该框架解决了语音可懂度和生成速度之间的权衡问题。这种新方法将TTS表述为在X-Codec2神经音频编解码器令牌上的条件块状离散扩散。通过将序列分解为块并在每个块内应用掩码扩散,DLLM-TTS实现了高效的并行生成,实时因子为0.15,同时在Seed-TTS-eval等基准测试中保持了有竞争力的性能。

  3. RESEARCH · CL_99943 ·

    新方法揭示风格指令如何塑造文本到语音输出

    研究人员开发了一种新方法,用于理解自然语言指令如何影响风格字幕文本到语音(TTS)系统的输出。通过将DAAM框架应用于语音扩散模型,该研究分析了风格字幕中的特定词语如何塑造生成的波形。研究结果表明,风格标记比内容标记具有更低的时间方差,并且它们的影响在生成早期阶段和模型的深层中达到峰值。

  4. RESEARCH · CL_99946 ·

    FlowEdit 实现 TTS 模型终身发音适应

    研究人员开发了 FlowEdit,一个新颖的框架,旨在使冻结的流匹配文本到语音(TTS)系统能够进行终身发音纠正。FlowEdit 不会重新训练整个模型,而是在文本嵌入空间中将发音调整学习为潜在编辑。这些纠正存储在现代 Hopfield 网络中,充当联想记忆,并在推理过程中通过软注意力检索。这种方法显著减少了专有名词的发音错误,在多语言基准测试中语音错误率(Phoneme Error Rate)相对降低了 92.7%,同时保持了整体语音质量。