研究人员推出了WorldAuditBench,这是一个旨在测试多模态智能体在交互式3D环境中识别异常能力的新基准。该基准使用Unreal Engine 5和Three.js构建,包含13个环境中的213个异常任务。对五个领先模型的评估显示,成功率远低于人类表现,凸显了这些智能体在系统性探索和异常检测中结合行动和视觉推理能力的当前局限性。 AI
影响 该基准将帮助研究人员识别和解决多模态AI在复杂3D环境中导航和推理能力方面的局限性。
排序理由 该集群描述了一个用于评估AI模型的新学术基准。
在 Hugging Face Daily Papers 阅读 →
- Hugging Face
- Three.js
- Unreal Engine 5
- vision-language-action model
- vision-language model
- WorldAuditBench
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →