研究人员推出Cue2Narrate,这是一个新颖的两阶段流水线,旨在为视障观众改进音频描述。该系统联合预测内容以及在长电影片段中插入口头叙述的精确时间,超越了传统的视频字幕方法。为了支持这种新方法,开发了LongLSMDC基准,其中包含长达8分钟的电影片段。与现有基线相比,Cue2Narrate在本地化准确性和生成质量方面均显示出显著改进。 AI
影响 这项研究通过提高自动化音频描述的质量和相关性,有望为视障人士带来更易于访问的媒体内容。
排序理由 该集群包含一篇详细介绍音频描述生成新方法和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →