研究人员推出了 ReactHuman,这是一个旨在评估具身人工智能系统中多模态大语言模型(MLLMs)反应式决策能力的新基准测试。该基准测试侧重于人形代理在模拟家庭环境中响应突发物理危险的能力,评估反应的合理性、安全性和物理基础。对七个 MLLMs 的评估显示出明显的不足,模型大约三分之一的危险处理不当,并表现出信任外观而非运动的倾向,这表明反应式安全仍然是部署这些代理的关键挑战。 AI
影响 该基准测试突显了当前 MLLMs 在实际机器人应用中的关键安全差距,推动了对更强大、更具物理基础的 AI 代理的研究。
排序理由 该集群描述了一个用于评估 AI 模型的新学术基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →