PulseAugur
实时 07:07:59
English(EN) EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

新的EgoSafe基准挑战LVLMs进行第一人称视觉安全推理

研究人员推出了EgoSafe-Bench,这是一个旨在评估大型视觉语言模型(LVLMs)视觉安全理解能力的新基准。该基准侧重于以自我为中心、第一人称的视频场景,并采用分层推理评估(HRE)协议来探究因果推理、盲点推断和意图推断。对Qwen3 VL、Gemini和VideoLLaMA 3等模型的初步评估显示,它们的描述能力与其强大的因果推理能力之间存在显著差距,这表明需要更具逻辑性的视频理解系统。 AI

影响 该基准可以推动更强大、更具因果意识的视频理解系统的发展,这对于安全关键型应用至关重要。

排序理由 该集群描述了一个新的学术基准和AI模型评估框架,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的EgoSafe基准挑战LVLMs进行第一人称视觉安全推理

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng ·

    EgoSafe:用于视觉安全理解的第一人称移动捕获基准

    arXiv:2607.26518v1 Announce Type: new Abstract: Reliable visual safety understanding in real-world scenarios demands more than just object recognition; it requires causal reasoning under epistemic uncertainty. While Large Vision-Language Models (LVLMs) demonstrate impressive sema…