PulseAugur
实时 08:37:46
English(EN) TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA 模型在没有大型语言模型的情况下提供高效的实时机器人控制

研究人员开发了 TurboVLA,一种新颖的视觉-语言-动作 (VLA) 模型,它绕过了使用大型语言模型作为机器人控制中间体的需求。这种新范式直接将视觉和语言输入映射到动作,显著降低了计算和内存需求。TurboVLA 在 LIBERO 基准测试中取得了高成功率,同时具有紧凑的模型尺寸、低推理延迟和消费者硬件上极少的 VRAM 使用量,为现有的以 LLM 为中心的 VLA 方法提供了一种高效的替代方案。 AI

影响 该模型的效率可以使先进的机器人控制在实际应用中得到更广泛、更易于访问的使用。

排序理由 该条目描述了一个新模型及其在基准测试上的性能,符合研究类别。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

TurboVLA 模型在没有大型语言模型的情况下提供高效的实时机器人控制

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

    Vision-language-action (VLA) models commonly adopt an LLM-centric $V \to L \to A$ pathway, where visual observations are projected into the representation space of a large language model before being decoded into robot actions. Although effective, this design incurs substantial c…