研究人员开发了 TurboVLA,一种新颖的视觉-语言-动作 (VLA) 模型,它绕过了使用大型语言模型作为机器人控制中间体的需求。这种新范式直接将视觉和语言输入映射到动作,显著降低了计算和内存需求。TurboVLA 在 LIBERO 基准测试中取得了高成功率,同时具有紧凑的模型尺寸、低推理延迟和消费者硬件上极少的 VRAM 使用量,为现有的以 LLM 为中心的 VLA 方法提供了一种高效的替代方案。 AI
影响 该模型的效率可以使先进的机器人控制在实际应用中得到更广泛、更易于访问的使用。
排序理由 该条目描述了一个新模型及其在基准测试上的性能,符合研究类别。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →