研究人员开发了AVSRBench,一个旨在评估视听语音识别(AVSR)系统在标准广播语音之外的各种挑战性条件下的新基准。研究发现,当前的AVSR架构在泛化方面存在困难,在涉及过度发音、朗读语音和即兴对话的任务上性能显著下降。视觉理解在侧面视图下也会失效,多模态系统通常严重依赖声学回退。研究强调,说话人的发音比轻微的摄像头移动更关键,基于LLM的架构表现出较差的域外泛化能力。为了促进更好的评估,AVSRBench和统一的数据预处理流程已被引入。 AI
影响 突出了当前AVSR泛化能力的局限性,可能指导未来研究朝着更强大的多模态系统发展。
排序理由 介绍新基准和评估结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →