研究人员推出CineSubBench,这是一个旨在利用多语言电影字幕评估大型语言模型(LLM)长上下文理解能力的新基准。该基准包含来自六种语言的1000多部电影,总计超过800万条带时间戳的字幕条目。CineSubBench评估七项任务,包括叙事重建、类型预测、年龄适宜性和语言安全,旨在将电影确立为评估LLM在叙事、多语言和文化理解方面能力的领域。 AI
影响 确立电影作为评估LLM叙事、多语言和文化理解能力的领域。
排序理由 该项目描述了一个用于评估LLM的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →