研究人员开发了ProgVLA,一个紧凑的视觉-语言-动作模型,用于机器人操作,能够高效处理长多模态序列。它使用Perceiver重采样方案将视觉、语言和本体感觉数据压缩为固定数量的上下文令牌。该模型还包含通过强化学习训练的进度头,用于估计任务完成情况,从而实现更有效的模仿学习。一个0.1B参数版本的ProgVLA在操作基准测试中已显示出与更大模型相当的成功率,并在真实的厨房环境中得到了验证。 AI
影响 引入了一种更高效的机器人技能学习方法,有望实现更强大、资源更高效的机器人系统。
排序理由 这是一篇详细介绍机器人操作新模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →