研究人员开发了一种新的视觉-语言-动作(VLA)模型CamVLA,该模型无需显式校准即可适应不同的相机位置。该模型通过预测以相机为中心的末端执行器动作和手眼矩阵,将操纵控制与相机几何解耦。这种方法允许策略独立确定相机方向,使其在部署时仅凭单个RGB图像和任务指令即可有效运行,这在模拟和真实机器人数据中均得到了成功率提高的证明。 AI
影响 这项研究通过减少对精确相机校准的需求,可能带来更鲁棒和适应性更强的机器人系统。
排序理由 该集群描述了一篇介绍新模型的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →