PulseAugur
中
实时 19:18:02
实体 imitation learning

imitation learning

PulseAugur coverage of imitation learning — every cluster mentioning imitation learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
43
90 天内 43
发布 · 30天
0
90 天内 0
论文 · 30天
43
90 天内 43
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

LAB BRAIN
observation active 置信度 0.80

Imitation learning is being applied to complex robotics tasks with promising results

Multiple recent clusters show imitation learning being used successfully in diverse robotics applications, including humanoid manipulation (BiGym 2.0 benchmark), hydraulic crane operation for log pile clearing, and coordinated multi-robot trajectory execution (GAMBIT). These applications demonstrate the growing maturity and applicability of imitation learning beyond simpler control problems.

hypothesis resolved confirmed 置信度 0.75

Imitation learning research to focus on closed-loop stability and safety constraints

Recent research highlights stability issues and the need for explicit training for closed-loop reactivity in imitation learning. Concurrently, new methods like IPGD are being developed to enforce safety constraints during training. This suggests a near-term trend where imitation learning research will increasingly prioritize robustness to errors and adherence to safety protocols for real-world deployment.

hypothesis resolved confirmed 置信度 0.70

Hybrid imitation learning and reinforcement learning approaches will gain traction

The GAMBIT framework for multi-robot coordination and the log-clearing crane policy both utilize imitation learning for initial policy learning, followed by reinforcement learning for refinement. This hybrid approach appears effective for leveraging the strengths of both methods, suggesting that more research and development will explore similar combined strategies for complex tasks.

查看全部假设 →

最近 · 第 1/3 页 · 共 44 条
  1. TOOL · CL_289418 ·

    新的Agentic Critical Training方法提升了LLM代理的性能

    研究人员推出了一种名为Agentic Critical Training (ACT) 的新方法,通过训练语言模型代理评估动作而非仅仅模仿动作来增强其能力。与传统的模仿学习不同,ACT使用具有可验证奖励的强化学习来教会模型区分专家动作和可能的错误。该方法在ALFWorld、WebShop和ScienceWorld等多个基准测试中表现出显著的改进,优于监督微调和CoT提示等现有方法。

  2. TOOL · CL_284723 ·

    AI策略学会用液压起重机清理原木堆

    研究人员为液压起重机开发了一种新的模仿学习策略,用于清理原木堆,在模拟中取得了98%的成功率。该策略基于点云数据训练,可预测抓取目标和方向,在实际试验中通过存放93.8%的库存,优于几何启发式方法。通过强化学习进一步优化,提高了载荷稳定性和堆放成功率,展示了AI在工业物流中的潜力。

  3. TOOL · CL_284720 ·

    BiGym 2.0 基准测试人形机器人操作技能

    一个名为 BiGym 2.0 的新基准套件已被开发出来,用于评估人形家庭操作能力,特别是针对 Unitree G1 机器人。该套件包含 20 项家庭任务,每项任务都有 60 次人类演示和同步的多摄像头视图。研究人员对包括视觉-语言-动作微调、模仿学习、演示驱动强化学习和编码代理在内的各种人工智能方法进行了基准测试,发现视觉-语言-动作微调在九项任务的平均表现最佳。然而,在多物体运输和复杂堆叠等领域仍然存在挑战,这表明当前的方法在双臂操…

  4. TOOL · CL_284700 ·

    新的模仿学习方法增强了神经网络控制策略的安全性

    研究人员开发了一种名为交错投影梯度下降(IPGD)的新型模仿学习技术,旨在训练神经网络控制策略,同时遵守状态和输入约束。该方法将标准的模仿梯度步骤与安全步骤交替进行,安全步骤将动作投影到安全集合上,旨在满足训练过程中的约束并提高在实际应用中的性能。在自动驾驶赛车任务的模拟中,与基于惩罚的方法相比,IPGD 显著减少了约束违反,在达到可比的单圈时间的同时,表现出对参数调整更大的鲁棒性。

  5. TOOL · CL_282159 ·

    新的GAMBIT框架学习协调多机器人轨迹

    研究人员开发了GAMBIT,一个用于学习协调运动原语以执行多机器人轨迹的新框架。该方法使用模仿学习来初步捕捉协调行为,然后通过强化学习来优化策略。与现有的集中式和分布式规划方法相比,GAMBIT表现出卓越的性能,在连续域中成功协调了千余台机器人,规划延迟低于几百毫秒。

  6. TOOL · CL_275061 ·

    新研究质疑模仿学习中行动分块的稳定性假设

    一篇新的arXiv研究论文探讨了模仿学习中行动分块的稳定性问题,这是一种用于提高策略性能的技术。该研究向系统注入错误,以衡量在开环和闭环执行机制下错误增长或缩小的速度。研究结果表明,稳定状态很少见,错误放大很常见,传播速率受拟合范围的严重影响。研究表明,需要显式训练闭环反应能力,而不是仅仅依赖标准的模仿学习来处理偏差。

  7. RESEARCH · CL_271387 ·

    新的模仿学习方法提升机器人可靠性和性能 · 追踪4个来源

    研究人员正在开发新的方法来改进机器人的模仿学习,重点是通过不完美的数据来增强可靠性和性能。Rewind-IL 通过使用时间差异估计和状态重置机制,引入了一个在线故障检测和恢复框架。Disagreement-Regularized Imitation Learning (DRIL) 将策略分歧转化为强化学习奖励,在少数演示设置中显示出显著的收益。SynIL 利用运动协同作用自动评估演示质量并为离线学习生成奖励信号,在基准数据集上表现优于…

  8. TOOL · CL_286423 ·

    大规模离线策略学习研究训练了超过 16 万个策略

    一项新研究在 114 个数据集上训练了超过 16 万个策略,以研究影响强化学习和模仿学习中离线策略学习的因素。研究发现,没有单一算法能始终占主导地位,顶尖方法的性能通常非常接近,但因环境而异。适当的超参数调整被证明会频繁改变算法的排名,而基准测试的构成可能导致相互矛盾的结论。为了提高研究的可靠性,该研究引入了 JumpStart,这是一个资源套件,包括所有训练过的策略、分数和超参数、基线和代码,以及一个用于分析和贡献的网站。

  9. TOOL · CL_249110 ·

    机器人模仿学习指南发布

    本文提供了一份机器人模仿学习(IL)的实现指南,重点关注从头开始训练的基于视觉的策略。它将IL与经典的显式策略和强化学习进行了对比,强调了IL无需手工算法或大量模拟的优势。该指南使用PyTorch、MuJoCo模拟和RoboSuite包来训练机器人在抓取方块等任务上的表现,并强调了基于传感器输入的泛化适应学习。

  10. RESEARCH · CL_231643 ·

    模仿学习在机器人操作任务中难以应对速度变化

    一篇新的研究论文探讨了模仿学习在灵巧机器人操作中的时间鲁棒性。研究发现,虽然模仿学习策略在标称速度下可以达到很高的成功率,但与专家策略相比,当任务执行速度增加时,其性能下降得更为严重。失败主要归因于插入错位,这表明模仿学习可能无法完全保留专家在压缩时间表下的适应能力。

  11. RESEARCH · CL_221111 ·

    $R^3$ 训练机器人进行自然语言推理以完成操作任务

    研究人员开发了一种名为 $R^3$ 的新方法,该方法训练视觉语言模型 (VLM) 以在机器人操作任务中进行自然语言推理。这种训练后技术涉及在中期使用专家推理轨迹对 VLM 进行训练,然后通过从离线动作数据中进行强化学习来对其进行优化。 $R^3$ 方法旨在通过使用自由形式的语言推理来指导低级策略,使机器人能够处理复杂的、长期的任务,在 Language Table 和杂货打包等基准测试中,与模仿学习基线相比,表现出更好的探索和泛化能力。

  12. RESEARCH · CL_216117 ·

    机器人模仿学习进展聚焦于遗忘和时间上下文

    研究人员正在探索机器人模仿学习的新方法,重点关注如何基于人类演示有效地训练和管理策略。其中一种方法,在 arXiv 论文中有所详述,引入了“重新训练校准审计”来衡量演示遗忘,评估行为变化和已移除数据的残留证据。另一篇在 Hugging Face 上发表的论文介绍了“WorldToken”,一种时间优先序列建模技术,它将异构机器人观测融合到由因果 Transformer 处理的世界标记中,并在需要长期时间上下文的任务上证明了其有效性。

  13. TOOL · CL_208484 ·

    机器人抓取与放置系统使用视觉提示和模仿学习

    研究人员开发了一种用于零售环境中机器人操作的新感知-行动流程,特别是针对抓取与放置任务。该系统利用标注引导的视觉提示,其中边界框突出显示要抓取的物体及其放置位置,提供结构化的空间引导。该方法采用带 Transformer 的动作分块 (ACT),一种模仿学习算法,从人类演示中预测动作序列,从而实现更平滑、更自适应的机器人操作。评估表明在复杂的零售环境中抓取准确性和适应性有所提高。

  14. TOOL · CL_206482 ·

    新AI框架模仿治疗师-患者互动,用于机器人康复

    研究人员开发了一个新的框架,使用任务参数化高斯混合模型(TPGMM)来更好地复制机器人辅助上肢训练中个性化的物理治疗师-患者互动。该方法旨在通过从少量演示中学习并推广到新的任务变体,来提高康复机器人的有效性。在对三个任务的模拟治疗师-患者配对进行的评估中,TPGMM框架在重现未见任务变体的治疗师扭矩方面,比查找表方法略有改进,并且随着任务复杂度的增加,性能有所提高。

  15. TOOL · CL_206247 ·

    新算法增强了分布偏移下的软体机器人控制能力

    研究人员开发了DiSA-IQL,一种新颖的离线强化学习算法,旨在改进软体蛇形机器人的控制。该方法解决了分布偏移的挑战,分布偏移通常会在遇到未见过的情景时降低离线强化学习算法的性能。通过引入惩罚不可靠状态-动作对的鲁棒性调制,DiSA-IQL在分布内和分布外评估中均表现出优于行为克隆、保守Q学习和标准隐式Q学习等现有方法的性能。

  16. TOOL · CL_178422 ·

    镜像学习框架利用第三人称数据增强模仿学习

    研究人员引入了一个名为“镜像学习”的新颖框架,通过利用第三人称观察数据来增强模仿学习。该方法结合了一个由微调视频扩散模型驱动的学习视角转换和一个逆动力学模型来推断动作轨迹。该方法生成“镜像数据”,这是通过观察演示者行为合成的伪第一人称专家数据,即使没有直接的第一人称数据也能进行有效的策略训练。用这些镜像数据增强传统的行为克隆已被证明可以提高下游策略的性能,这表明生成式世界模型可以为数据收集提供一种可扩展且安全的选择,替代大量的远程操作。

  17. RESEARCH · CL_172048 ·

    机器人研究在跨具身技能迁移方面取得进展 · 跟踪4个来源

    研究人员开发了新的方法来改进机器人领域的跨具身迁移,使模型能够将在不同机器人形态上学习到的操作技能进行泛化。一种方法,“通过行为对齐表示进行跨具身迁移”,利用了视觉语言动作(VLA)模型中的末端执行器轨迹等表示,在模拟到现实的迁移中显示出28%的改进。另一种方法,“ContactFlow”,引入了一种基于3D接触点轨迹的具身无关动作表示,该表示允许在多样化的人类和机器人交互数据上训练世界模型,并展示了在不同机器人具身之间的成功迁移。

  18. TOOL · CL_169759 ·

    机器人操作框架通过模仿学习适应上下文

    研究人员开发了一个新的机器人操作框架,通过适应不断变化的环境上下文来增强鲁棒性和反应能力。该方法利用模仿学习来获取以机器人状态和任务特定参数为条件的策略。通过结合专家混合模型和不确定性感知策略,该系统旨在提高分布外鲁棒性和收敛性,这已在手写和真实机器人任务中得到证明。

  19. TOOL · CL_154059 ·

    新的强化学习方法教会 AI 代理何时规划或反应

    研究人员开发了一种新的强化学习方法来训练人工智能代理进行元推理,使其能够决定是进行快速的反应式决策还是缓慢的审议式规划。该方法使用一种元推理策略,预测反应式策略何时可能表现不佳,从而发出信号表明需要通过规划进行更多计算。在运动规划和导航环境中的实验表明,该系统可以有效地学习何时进行规划,而不是依赖于反应式策略,并且它能够适应以提高反应式策略的性能。

  20. RESEARCH · CL_133612 ·

    新研究推动AI对齐和模仿学习中的样本效率

    研究人员开发了新的方法来改进人工智能代理与人类价值观的对齐。一种方法是反馈操纵正则化(FMR),它利用评估反馈作为模仿学习中的纠正信号来增强策略对齐,在适应性安全体育馆环境中显著减少了不对齐现象。另一项研究为离策略对抗模仿学习(AIL)算法提供了理论保证,表明重用近期策略的样本可以在不影响收敛的情况下提高样本效率,为更具数据效率的AIL提供了理论基础。