Researchers have introduced CineSubBench, a new benchmark designed to evaluate the long-context understanding capabilities of large language models (LLMs) using multilingual movie subtitles. This benchmark includes over 1,000 films across six languages, totaling more than 8 million timestamped subtitle entries. CineSubBench assesses seven tasks, including narrative reconstruction, genre prediction, age suitability, and language safety, aiming to establish film as a domain for evaluating LLMs' abilities in narrative, multilingual, and cultural comprehension. AI
IMPACT Establishes film as a domain for evaluating LLM narrative, multilingual, and cultural comprehension capabilities.
RANK_REASON The item describes a new academic benchmark for evaluating LLMs. [lever_c_demoted from research: ic=1 ai=1.0]
Read on Hugging Face Daily Papers →
AI-generated summary · Google Gemini · from 2 sources. How we write summaries →