研究人员发现,不同的视觉-语言-动作(VLA)模型骨干在利用视觉捷径学习方面易感性不同,这种捷径利用了与视角或背景等无关特征的虚假关联。他们提出了一种“动作裕度”指标来评估这一点,发现视觉捷径出现在模型的早期层,有时会被整合了语言信息的后期层纠正。为了缓解这种情况,引入了一种名为“任务擦除”的新领域对抗训练方法,该方法减少了对视觉捷径的依赖,并增强了VLA在模拟和真实世界实验中的泛化能力。 AI
影响 这项研究通过减少对虚假视觉线索的依赖,有望带来更强大、更可靠的机器人学习系统。
排序理由 这是一篇详细介绍改进AI模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →