研究人员开发了SPRINT,一个旨在评估多模态大语言模型(MLLMs)积极风险推理能力的新基准。该基准利用了2,888个真实世界的体育视频,包括详细的危险线索和事故原因标注,以测试MLLMs预测物理危险的能力。当前最先进的MLLMs显示出显著的差距,它们擅长危险检测,但在识别根本原因方面存在困难,并且倾向于在安全视频上产生误报。 AI
影响 强调了当前MLLMs在现实世界物理安全应用中的局限性,表明需要改进因果推理。
排序理由 该条目描述了在arXiv上发表的一个新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →