研究人员开发了ZimaBlue框架,旨在从大规模视频数据中学习可泛化的世界动作模型(WAMs)。该方法采用三阶段课程学习:首先是因果具身视频预训练,然后是中间训练以将视觉动力学与机器人轨迹相结合,最后是模型专业化以进行部署。该系统采用双慢快架构实现实时动作预测,在机器人操作任务中取得了显著改进,当具身视频数据规模扩大时,成功率从36.1%提高到77.8%。 AI
影响 这项研究通过使模型能够从现成的视频数据中学习复杂动作,有可能显著提升机器人操作能力。
排序理由 该集群包含一篇详细介绍从视频数据学习世界动作模型新框架的研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →