A new benchmark, TraceAV-Bench, has been introduced to evaluate multi-hop reasoning capabilities in OmniLLMs over long audio-visual videos. The benchmark includes 2,200 questions across 578 videos, totaling over 339 hours, and assesses multimodal hallucination robustness. Current leading models, including Gemini 3.1 Pro and Ming-Flash-Omni-2.0, show significant limitations, with the best-performing model achieving only 68.29% accuracy, indicating a substantial gap in long-form audio-visual reasoning. AI
IMPACT Highlights limitations in current OmniLLMs for complex, long-form audio-visual tasks, guiding future research and development.
RANK_REASON The cluster describes a new academic benchmark for evaluating AI models, detailed in an arXiv paper. [lever_c_demoted from research: ic=1 ai=1.0]
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →