Human Demonstrations
PulseAugur coverage of Human Demonstrations — every cluster mentioning Human Demonstrations across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
ReWeight框架通过人类演示数据改进机器人学习
研究人员开发了ReWeight,一个旨在增强机器人视觉-语言-动作(VLA)模型训练后能力的创新框架。该方法通过利用丰富的第一人称人类演示数据,解决了机器人数据收集成本高昂的挑战。ReWeight采用检索和加权系统来弥合人类数据和机器人数据之间的差距,学习跨具身视觉运动表征以衡量行为相似性。评估显示性能显著提升,ReWeight将模拟成功率从39%提高到57%,并在现实世界任务中达到了68.8%的成功率,大幅优于基线方法。
-
新的大型语言模型训练方法结合了可验证的奖励和人类演示
研究人员开发了一个新的大型语言模型(LLM)训练框架,该框架结合了可验证的奖励和人类演示。这种方法解决了当前仅关注客观指标的方法的局限性,这些方法常常忽略风格和结构等主观质量,可能导致不自然的响应和奖励漏洞等问题。提出的对抗性生成器-判别器模型学会优化任务准确性和源自人类示例的对抗性奖励信号,从而有效地捕捉输出质量的不可验证方面。在修复错误、故事生成和奖励漏洞基准测试中的实验表明,在保持或提高客观性能的同时,这些主观质量得到了显著改善。
-
机器人通过关键点跟踪从人类视频中学习操作
研究人员开发了一个名为 Dexterous Point Policy 的新框架,可以直接从人类视频中学习机器人操作技能,无需昂贵的机器人特定演示。该系统利用统一的物体和手部三维关键点表示来弥合人类和机器人动作之间的差距。该方法在现实世界任务中取得了 75.0% 的成功率,显著优于仅取得 1.0% 成功率的最先进基线。