PulseAugur
实时 07:17:41
实体 imitation learning

imitation learning

PulseAugur coverage of imitation learning — every cluster mentioning imitation learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 33
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 32
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 33 条
  1. RESEARCH · CL_216117 ·

    机器人模仿学习进展聚焦于遗忘和时间上下文

    研究人员正在探索机器人模仿学习的新方法,重点关注如何基于人类演示有效地训练和管理策略。其中一种方法,在 arXiv 论文中有所详述,引入了“重新训练校准审计”来衡量演示遗忘,评估行为变化和已移除数据的残留证据。另一篇在 Hugging Face 上发表的论文介绍了“WorldToken”,一种时间优先序列建模技术,它将异构机器人观测融合到由因果 Transformer 处理的世界标记中,并在需要长期时间上下文的任务上证明了其有效性。

  2. TOOL · CL_208484 ·

    机器人抓取与放置系统使用视觉提示和模仿学习

    研究人员开发了一种用于零售环境中机器人操作的新感知-行动流程,特别是针对抓取与放置任务。该系统利用标注引导的视觉提示,其中边界框突出显示要抓取的物体及其放置位置,提供结构化的空间引导。该方法采用带 Transformer 的动作分块 (ACT),一种模仿学习算法,从人类演示中预测动作序列,从而实现更平滑、更自适应的机器人操作。评估表明在复杂的零售环境中抓取准确性和适应性有所提高。

  3. TOOL · CL_206482 ·

    新AI框架模仿治疗师-患者互动,用于机器人康复

    研究人员开发了一个新的框架,使用任务参数化高斯混合模型(TPGMM)来更好地复制机器人辅助上肢训练中个性化的物理治疗师-患者互动。该方法旨在通过从少量演示中学习并推广到新的任务变体,来提高康复机器人的有效性。在对三个任务的模拟治疗师-患者配对进行的评估中,TPGMM框架在重现未见任务变体的治疗师扭矩方面,比查找表方法略有改进,并且随着任务复杂度的增加,性能有所提高。

  4. TOOL · CL_206247 ·

    新算法增强了分布偏移下的软体机器人控制能力

    研究人员开发了DiSA-IQL,一种新颖的离线强化学习算法,旨在改进软体蛇形机器人的控制。该方法解决了分布偏移的挑战,分布偏移通常会在遇到未见过的情景时降低离线强化学习算法的性能。通过引入惩罚不可靠状态-动作对的鲁棒性调制,DiSA-IQL在分布内和分布外评估中均表现出优于行为克隆、保守Q学习和标准隐式Q学习等现有方法的性能。

  5. TOOL · CL_178422 ·

    镜像学习框架利用第三人称数据增强模仿学习

    研究人员引入了一个名为“镜像学习”的新颖框架,通过利用第三人称观察数据来增强模仿学习。该方法结合了一个由微调视频扩散模型驱动的学习视角转换和一个逆动力学模型来推断动作轨迹。该方法生成“镜像数据”,这是通过观察演示者行为合成的伪第一人称专家数据,即使没有直接的第一人称数据也能进行有效的策略训练。用这些镜像数据增强传统的行为克隆已被证明可以提高下游策略的性能,这表明生成式世界模型可以为数据收集提供一种可扩展且安全的选择,替代大量的远程操作。

  6. RESEARCH · CL_172048 ·

    机器人研究在跨具身技能迁移方面取得进展 · 跟踪4个来源

    研究人员开发了新的方法来改进机器人领域的跨具身迁移,使模型能够将在不同机器人形态上学习到的操作技能进行泛化。一种方法,“通过行为对齐表示进行跨具身迁移”,利用了视觉语言动作(VLA)模型中的末端执行器轨迹等表示,在模拟到现实的迁移中显示出28%的改进。另一种方法,“ContactFlow”,引入了一种基于3D接触点轨迹的具身无关动作表示,该表示允许在多样化的人类和机器人交互数据上训练世界模型,并展示了在不同机器人具身之间的成功迁移。

  7. TOOL · CL_169759 ·

    机器人操作框架通过模仿学习适应上下文

    研究人员开发了一个新的机器人操作框架,通过适应不断变化的环境上下文来增强鲁棒性和反应能力。该方法利用模仿学习来获取以机器人状态和任务特定参数为条件的策略。通过结合专家混合模型和不确定性感知策略,该系统旨在提高分布外鲁棒性和收敛性,这已在手写和真实机器人任务中得到证明。

  8. TOOL · CL_154059 ·

    新的强化学习方法教会 AI 代理何时规划或反应

    研究人员开发了一种新的强化学习方法来训练人工智能代理进行元推理,使其能够决定是进行快速的反应式决策还是缓慢的审议式规划。该方法使用一种元推理策略,预测反应式策略何时可能表现不佳,从而发出信号表明需要通过规划进行更多计算。在运动规划和导航环境中的实验表明,该系统可以有效地学习何时进行规划,而不是依赖于反应式策略,并且它能够适应以提高反应式策略的性能。

  9. RESEARCH · CL_133612 ·

    新研究推动AI对齐和模仿学习中的样本效率

    研究人员开发了新的方法来改进人工智能代理与人类价值观的对齐。一种方法是反馈操纵正则化(FMR),它利用评估反馈作为模仿学习中的纠正信号来增强策略对齐,在适应性安全体育馆环境中显著减少了不对齐现象。另一项研究为离策略对抗模仿学习(AIL)算法提供了理论保证,表明重用近期策略的样本可以在不影响收敛的情况下提高样本效率,为更具数据效率的AIL提供了理论基础。

  10. TOOL · CL_128934 ·

    新的SILO框架增强了机器人布线任务的仿真到现实迁移能力

    研究人员开发了一种新颖的模拟回路中的仿真 (SILO) 强化学习框架,用于多阶段布线任务。该方法利用GPU并行仿真来近似线性可变形行为,使策略能够泛化到各种电缆几何形状和变形模式。SILO框架结合了局部强化学习策略和鲁棒的电缆状态估计,以弥合仿真到现实的差距,在真实世界任务中与先前最先进的方法相比,成功率更高,周期时间缩短了一半。

  11. TOOL · CL_131099 ·

    SIEVE方法通过结构感知数据选择增强VLA模仿学习

    研究人员推出了一种用于视觉-语言-动作(VLA)模仿学习中的数据选择新方法SIEVE。SIEVE识别机器人演示数据集中的可重用视觉-运动基元和过渡接口,以提高策略学习的效率。实验表明,SIEVE在仅使用显著更少的数据和训练步数的情况下,即可达到与全数据训练相当或更优的性能。

  12. TOOL · CL_123252 ·

    新研究详细介绍了逆动力学模型在模仿学习中的样本效率

    一篇新的研究论文探讨了逆动力学模型(IDMs)在半监督模仿学习中的样本效率。研究表明,在一种称为基于IDM策略的极限情况下,VM-IDM和IDM标注方法学习到了相同的策略。研究人员将基于IDM策略的优越样本效率归因于其比专家策略更低的复杂度假设类和更低的随机性,这得到了统计学习理论以及在Procgen和LIBERO等基准测试上的实验支持。该论文还介绍了一种改进的用于潜在动作策略学习的LAPO算法。

  13. TOOL · CL_123096 ·

    WorldSample框架通过合成数据提升真实机器人强化学习

    研究人员开发了WorldSample,一个旨在改进真实世界机器人强化学习(RL)的框架。该系统在物理机器人交互与生成的世界模型之间创建了一个闭环,能够生成高保真合成数据。通过使用策略调步学习(Policy-Paced Learning),WorldSample调节训练过程,以平衡有用增强与潜在的高估和噪声,从而显著减少训练步骤并提高机器人操作任务中的策略成功率。

  14. RESEARCH · CL_117378 ·

    强化学习优化风电场数据中心能源使用

    本文探讨了使用强化学习(RL)优化与风电场相结合的数据中心运营。研究人员开发了一个模拟框架,用于测试RL代理进行工作负载转移,目标是在考虑削减的情况下最大限度地利用风能。研究发现,尽管像Proximal Policy Optimization(PPO)和Soft Actor-Critic(SAC)这样的RL代理表现强劲,但由于其在线决策的局限性,它们仍落后于离线优化器。论文还评估了模仿学习和奖励塑形作为提高RL性能的方法。

  15. TOOL · CL_109979 ·

    新型ACT-JEPA架构增强AI策略表示学习

    研究人员开发了ACT-JEPA,这是一种结合了模仿学习(IL)和自监督学习(SSL)的新型架构,以改进策略表示学习。该方法进行端到端训练,以预测动作序列和潜在观测序列,利用联合嵌入预测架构(Joint-Embedding Predictive Architecture)过滤不相关细节并构建强大的世界模型。评估表明,ACT-JEPA的表现优于现有基线,在世界模型理解方面提高了40%,任务成功率提高了10%。

  16. RESEARCH · CL_100172 ·

    新的强化学习框架使用语言进行自适应指导;调查涵盖大语言模型蒸馏技术 · 跟踪 2 个来源

    研究人员推出了一种名为“带语言指令的分层强化学习”(HRLLI)的新型框架,该框架通过在决策过程中动态选择相关的自然语言指导来提高强化学习的效率。这种被称为“选择即行动”(Select-to-Act)的方法将指令分解为特定阶段的元素,使高层策略能够指导低层策略进行自适应动作选择。在RTFM基准上的实验表明,HRLLI优于现有的指令条件强化学习基线。此外,一项调查回顾了大语言模型的“同策略蒸馏”(OPD)技术,解决了将前沿能力转移到更小…

  17. TOOL · CL_98068 ·

    新的R2BC方法支持单人训练多机器人系统

    研究人员开发了轮流行为克隆(R2BC),一种使用顺序单智能体演示来训练多机器人系统的新颖方法。该方法允许单个操作员通过一次遥操作一个机器人来教授复杂的多智能体行为,而无需同步的多智能体演示。R2BC在模拟中表现出与传统行为克隆方法相当或更优的性能,并已成功部署到物理机器人上。

  18. TOOL · CL_89585 ·

    麻省理工学院学生因人工智能研究获得赫兹奖学金

    四名与麻省理工学院有关联的个人因其在人工智能研究方面做出的重大贡献而获得了享有盛誉的赫兹奖学金。他们的工作涵盖预测模型和模仿学习等领域,这凸显了麻省理工学院学生因在人工智能领域取得的进步而获得此项认可的日益增长的趋势。

  19. RESEARCH · CL_93743 ·

    机器人方法使用强化学习处理缺失的传感器数据

    研究人员开发了RL4IL,一种新颖的强化学习方法,旨在增强机器人领域的多模态模仿学习,特别是在传感器数据缺失的情况下。该方法利用强化学习从训练库中识别和检索最相关的专家演示。然后,一种软融合技术聚合来自这些选定演示的操作信号,使机器人即使在某些模态不可用时也能预测适当的操作,而无需重新训练系统。

  20. TOOL · CL_86778 ·

    新AI策略通过人类偏好学习增强人行道导航

    研究人员开发了FlowPilot,这是一种仅使用单目RGB摄像头进行自主人行道导航的新型导航策略。该系统通过在大型机器人车队数据上使用锚定流匹配进行预训练,并采用人为干预的偏好学习方案来增强反事实推理和社会合规性,从而解决了传统模仿学习的局限性。FlowPilot在模拟和真实环境中都取得了显著成功,提高了路线完成率并降低了干预率。