研究人员推出了EgoAfford,这是一个新的基准,旨在将面向任务的负担能力接地与以自我为中心的视觉观察和多步规划联系起来。该基准包括来自2000个生成场景的大约15.5k张经过人类验证的图像,以及来自26个任务的102张图像的真实世界数据集。为了应对这些挑战,他们还开发了EgoLens,一个具有特定角色掩码解码器的3B多模态大型语言模型。 AI
影响 引入了一个新的基准和模型,用于改进机器人感知和复杂任务规划。
排序理由 该集群描述了一篇介绍特定计算机视觉任务基准和模型的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Connected Papers
- DagsHub
- EgoAfford
- EgoLens
- Gotit.pub
- Hugging Face
- Litmaps
- SAM2
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →