研究人员推出 ActionCodec,一种用于视觉-语言-动作 (VLA) 模型的新型动作分词方法。该方法侧重于优化 VLA 性能,而不仅仅是重建保真度,并确立了最大化时间分词重叠和最小化词汇冗余等设计原则。当应用于 SmolVLM2-2.2B 模型时,ActionCodec 在 LIBERO 基准测试上取得了 95.5% 的成功率,且无需先前的机器人训练,为 VLA 模型树立了新的最先进水平。 AI
影响 ActionCodec 的原则可能带来更高效、更有效的 VLA 模型,加速机器人和具身 AI 的进展。
排序理由 该集群描述了一篇关于 AI 模型中动作分词新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- ActionCodec
- arXiv
- Hugging Face
- LIBERO
- SmolVLM2-2.2B
- Vision-Language-Action (VLA)
- Vision Language Models (VLMs)
- Zibin Dong
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →