研究人员开发了ROMA,一个新设计用于真实场景中主动感知的大语言模型(LLM)系统。与被动整合感官数据的传统系统不同,ROMA通过与环境互动来主动寻找缺失的信息。该系统整合了视觉、听觉、触觉和力感应,并利用推理-互动-反馈循环来识别和获取必要的证据。为此,创建了一个名为ROMI-2K的大规模数据集,其中包含近2000个物体和6种原子交互。ROMA已证明其能够解决需要长串推理和交互的复杂多感官感知任务。 AI
影响 这项研究可能促成更复杂的具身AI代理,使其能够进行复杂的现实世界交互和理解。
排序理由 该条目描述了一篇新的研究论文,其中详细介绍了一个新颖的主动感知系统和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →