研究人员开发了VL-KnG,一个新颖的框架,它从以自我为中心的视频构建时空知识图谱,作为具身问答的持久化场景记忆。该方法允许视觉语言模型在不为每次查询重新处理原始视频的情况下维护对象身份和空间关系,从而显著降低延迟。VL-KnG在OpenEQA和WalkieKnowledge等基准测试中展示了具有竞争力的准确性,在某些场景下优于现有的持久化表示基线和开放权重VLM,并已成功部署在实体机器人上。 AI
影响 使具身AI代理能够维护持久化的场景记忆,提高查询效率,并实现与环境更复杂的交互。
排序理由 介绍具身AI新框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Graph-Enhanced Retrieval
- large language model
- Mohamad Al Mdfaa
- NavQNA
- OpenEQA
- Spatiotemporal Object Association
- vision-language models
- VL-KnG
- WalkieKnowledge
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →