一项新的基准测试TraceAV-Bench已被推出,用于评估OmniLLMs在长时音视频上的多跳推理能力。该基准测试包含578个视频中的2200个问题,总时长超过339小时,并评估了多模态幻觉鲁棒性。包括Gemini 3.1 Pro和Ming-Flash-Omni-2.0在内的当前领先模型显示出显著的局限性,表现最好的模型准确率仅为68.29%,表明在长时音视频推理方面存在巨大差距。 AI
影响 凸显了当前OmniLLM在复杂、长时音视频任务中的局限性,为未来的研究和开发指明方向。
排序理由 该集群描述了一个用于评估AI模型的新学术基准测试,详情见arXiv论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →