实体
Text-to-speech modeling
Text-to-speech modeling
PulseAugur coverage of Text-to-speech modeling — every cluster mentioning Text-to-speech modeling across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 2 条
-
DuplexGen框架生成具有涌现时序的合成对话语音
研究人员推出了一种新颖的合成对话语音生成框架DuplexGen,它能解耦内容、时序和声学。与预先编写对话时序的传统方法不同,DuplexGen使用大型语言模型生成脚本,然后由两个全双工对话模型实时交互。这种方法允许对话时序有机地涌现,同时保持脚本内容。高保真文本到语音模型随后渲染最终音频,而不改变涌现的时序,从而产生更自然的对话动态。
-
新的GATAS方法为ASR系统生成对抗性输入
研究人员开发了一种新颖的黑盒测试方法GATAS,用于自动语音识别(ASR)系统。该方法通过操纵文本到语音模型的潜在空间来生成对抗性输入,旨在诱导转录错误,同时保持语音的自然度。GATAS将攻击表述为一个多目标优化问题,平衡语义差异和感知质量。实证评估表明,与现有方法相比,GATAS在失真度较低和感知质量较好的情况下实现了高成功率,即使没有直接访问模型内部。