研究人员推出了AudioScape-TTA,这是一个旨在更精细地评估文本到音频(TTA)生成模型的新基准。与依赖广泛相似性度量的现有基准不同,AudioScape-TTA使用结构化语义注释和复杂性度量来评估生成的音频在多大程度上符合特定的文本指令,包括事件实现、声学属性和语音内容。对13个TTA模型的实验突显了在细粒度属性控制和组合声景生成方面持续存在的挑战,新的基于评分标准的评估显示出比传统方法更强的与人类判断的一致性。 AI
影响 增强了文本到音频模型的评估严谨性,有望提高它们生成复杂准确声景的能力。
排序理由 该条目描述了一篇介绍用于评估文本到音频模型的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- AudioScape-TTA
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- Scite
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →