PulseAugur
实时 10:41:34
English(EN) From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

新的基准测试了多模态大语言模型的积极安全性,揭示了显著的差距

研究人员开发了SPRINT,一个旨在评估多模态大语言模型(MLLMs)积极风险推理能力的新基准。该基准利用了2,888个真实世界的体育视频,包括详细的危险线索和事故原因标注,以测试MLLMs预测物理危险的能力。当前最先进的MLLMs显示出显著的差距,它们擅长危险检测,但在识别根本原因方面存在困难,并且倾向于在安全视频上产生误报。 AI

影响 强调了当前MLLMs在现实世界物理安全应用中的局限性,表明需要改进因果推理。

排序理由 该条目描述了在arXiv上发表的一个新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准测试了多模态大语言模型的积极安全性,揭示了显著的差距

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang ·

    从体育到安全:多模态大语言模型中主动风险推理的基准测试

    arXiv:2608.05560v1 Announce Type: cross Abstract: Timely anticipation of physical hazards is essential for real-world safety, yet existing MLLM evaluations focus on harmful content or general risks, leaving proactive physical hazard prediction underexplored. Sports provide a well…