研究人员推出 CapQuiz,这是一个旨在评估视觉大语言模型 (VLLM) 生成的视频字幕质量的新基准。与依赖直接文本匹配的现有指标不同,CapQuiz 根据字幕回答源自视频内容的细粒度多项选择题的能力来评估字幕。这种方法旨在衡量信息的保真度,确保字幕准确涵盖重要的视觉细节。CapQuiz 已证明与人类判断的相关性比以前的方法更强,并提供了对模型在各种视频领域性能的更具可解释性的见解。 AI
影响 引入了一种新的 VLLM 评估方法,有可能提高视频字幕评估的准确性和可解释性。
排序理由 该项目描述了一篇介绍用于评估人工智能模型的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CapQuiz
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
- Visual Large Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →