Franka
PulseAugur coverage of Franka — every cluster mentioning Franka across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
大型语言模型机器人越狱尝试中展现出意图-行为差距
研究人员发现,在大型语言模型(LLM)驱动的机器人中,意图中的恶意行为与其实际产生的有害行为之间存在显著差距,这被称为意图-行为差距。这种差异的出现是因为当前的越狱方法忽略了机器人特有的约束,例如可执行的控制API和物理可行性。为了解决这个问题,开发了一个名为POEF的新框架,通过考虑这些机器人特有的限制来优化越狱提示,在各种LLM和机器人平台上实现了80%的行为越狱成功率。研究结果强调,在LLM驱动的机器人广泛部署之前,迫切需要采取…
-
RoboCoach 利用世界模型改进机器人技能组合
研究人员开发了 RoboCoach,一个利用世界模型改进机器人技能组合的新框架。该系统使用 RIDI 循环(路线规划-想象-诊断-改进)在名为 COACHWORLD 的世界模型中模拟失败,识别需要额外演示或专家更新的特定子任务。这种有针对性的指导方法显著提高了机器人性能,在使用仅 150 次额外的子任务演示后,在 Franka 平台上的成功率从 13.3% 提高到 75.0%,在 AgileX 平台上的成功率从 40.0% 提高到 8…
-
新框架通过验证世界动作模型预测来增强机器人控制能力
研究人员推出了一种名为世界相干解码(WCD)的新型框架,旨在提高机器人领域中世界动作模型(WAMs)的可靠性。WCD通过将WAM的滚动预测视为可测试的假设,采样多种未来场景,并在执行前根据视觉合理性和动作稳定性进行排序。这种自验证过程利用内部生成信号来预测可靠性,从而在RoboTwin 2.0基准测试等任务上取得改进的性能。
-
新的SUN Programs框架统一了机器人操作中的控制与学习
研究人员开发了SUN Programs,一个统一了基于模型控制和学习策略以完成复杂操作任务的新框架。该系统名为Kuafu,可从语言和场景语义中自动合成这些程序,从而实现高效的策略训练。Kuafu在九项操作任务上展示了显著的成功率,优于现有方法,并实现了比人类远程操作更高的成功轨迹时间。
-
新的 GCRL 方法使用动态对象掩码进行视觉目标表示
研究人员开发了一种新颖的目标条件强化学习(GCRL)方法,该方法利用动态对象掩码作为目标表示。该方法绕过了对特权状态或位置信息的需要,而这些信息在实际机器人应用中通常不可用。通过使用基于图像的目标检测器,该系统可以为导航和操作任务生成空间目标,展示了广泛的适用性和强大的泛化能力。该方法在稳定性和样本效率方面显示出显著的改进,在机器人手臂上实现了高成功率,并在模拟中实现了更快的学习。
-
新的 MEMENTO 框架为具身 AI 任务演化代码即策略
研究人员开发了 MEMENTO,一个代表可执行代码的策略演化新框架。这种记忆引导的方法结合了进化方法和局部搜索技术,以提高策略在长时限具身任务上的性能。MEMENTO 在模拟机器人操作和家庭互动任务上展示了优于现有基线的结果,并且其有效性通过成功地从模拟到现实的迁移到物理机器人得到了进一步验证。
-
行智具身与复旦的30,000小时触觉数据让机器人获得“触感”
行智具身与复旦大学发布了一系列技术报告,介绍了N0系列模型,旨在通过整合触觉数据来增强具身智能。该项目包括一个包含超过30,000小时视觉-触觉交互数据的大型数据集,以及用于统一触觉表示的N0-Foundation模型和用于预测性触觉感知的N0-VTLA模型。这些进展旨在提高机器人的操纵能力,使它们能够通过触觉更好地理解和与物理世界互动,超越纯粹的视觉感知。
-
元力觉醒发布 DM0.5 具身智能模型,训练数据达 15 万小时
元力觉醒(Force Field Intelligence)发布了其新一代具身智能基础模型 DM0.5,该模型接受了 15 万小时数据的训练。DM0.5 旨在通过整合真实世界场景和开发者平台来解决具身智能领域的数据瓶颈问题。该模型拥有更大的参数规模、更多的数据量以及上下文抽象层和具身思维链任务等架构创新,在 Zero-Shot 泛化能力和微调效率方面取得了显著提升。
-
蚂蚁集团发布机器人开源模型LingBot-VLA 2.0 · 追踪2个来源
蚂蚁集团AI部门蚂蚁灵玎发布了LingBot-VLA 2.0,这是一个为复杂机器人任务设计的开源视觉-语言-动作(VLA)模型。新版本显著扩展了其训练数据至60,000小时,其中包含50,000小时的机器人轨迹数据和10,000小时的第一人称人类操作视频。LingBot-VLA 2.0支持来自17家制造商的20多种机器人配置,将其动作空间扩展到包括头部、腰部、末端执行器和移动基座,在物体操作和厨房清洁等任务中表现出改进的性能。
-
单一AI策略自主控制20种不同机器人本体
一项新的AI策略LingBot-VLA 2.0,已展示出控制20种不同机器人本体的能力,范围从单个机械臂到全人形机器人,所有机器人均自主运行。该通用策略接受了约60,000小时的数据训练,包括真实世界的机器人交互和人类视频。虽然该策略在各种机器人平台上显示出潜力,但其完成任务的成功率差异很大,在最后的精确操作阶段常常失败。
-
Uranus:新型世界模型充当具身AI裁判和模拟器
地平线机器人(Horizon Robotics)的衍生公司瓜瓜机器人(Guagua Robot)发布了Uranus,这是一款世界模型,旨在作为具身AI开发的底层基础设施,而非直接作为机器人的“大脑”。Uranus旨在解决该行业的两大痛点:缺乏可靠的基准测试以及模拟到现实的差距。它能够充当评估具身模型的客观“裁判”,并作为一个逼真的训练环境,生成高度逼真的、与现实世界场景高度匹配的模拟。
-
新框架使机器人能够从人类视频中学习操作技能
研究人员开发了Human2Any,一个旨在将人类视频中的操作技能转移到机器人上的框架。该系统从人类演示中学习可重用的物体交互先验,抽象掉特定于载体的细节。然后,Human2Any将这些先验与机器人特定的可行性推理和运动规划相结合,从而能够在目标任务不需要真实机器人训练数据的情况下适应不同的机器人和环境。该框架已在Franka桌面机器人和RBY-1人形机器人上得到验证。
-
新研究推进自动驾驶和机器人领域的世界行动模型
两篇新研究论文介绍了世界行动模型(WAMs)的先进方法,这对于模拟未来环境变化和规划行动至关重要,尤其是在自动驾驶和机器人领域。第一篇论文 ReWorld 专注于通过直接优化中间表示来改进 WAMs 中的表示学习,以实现更好的视频生成和规划。第二篇论文 DIM-WAM 通过整合多样化的历史事件记忆来增强 WAMs,以处理长时任务,显著提高了机器人操作场景下的性能。
-
新研究强调单视角网格重建在机器人领域泛化问题的挑战
一篇新研究论文探讨了单视角网格重建的局限性,这是一种用于机器人空间推理和数字孪生的技术。研究表明,当机器人安装的相机发生显著旋转时,现有方法在泛化方面存在困难,导致三维不一致和物理违反。研究人员开发了一个评估协议,在 Aria Digital Twin 和真实 Franka 机器人序列等数据集上测试这些模型,发现虽然规范物体网格保持稳定,但布局预测会出现漂移。该论文提出了一种称为“重力感知细化”的方法,以提高对这类旋转误差的鲁棒性。
-
新的Foresight框架使用世界模型检测机器人操作故障
研究人员开发了Foresight,一个用于检测长时程机器人操作任务中故障的新框架。该系统利用动作条件世界模型的潜在表征和函数式共形预测来监控机器人轨迹,仅需最终任务成功或失败标签即可进行训练。Foresight已在各种模拟基准上进行了评估,并在真实机器人手臂上进行了验证,展示了其在复杂机器人操作中可靠故障监控的潜力。
-
Qwen-RobotManip 模型通过统一对齐技术推进机器人操作
研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。
-
GeneralVLA-2 通过改进的 3D 重建和记忆来推进机器人规划
研究人员推出了 GeneralVLA-2,这是视觉-语言-动作系统在机器人规划方面的一项进步。该系统集成了 GeoFuse-MV3D 以增强 3D 重建,并改进了 KnowledgeBank 以更好地管理机器人任务中的记忆。GeoFuse-MV3D 组件通过融合几何并保留外观来解决单视图重建的局限性,而升级的 KnowledgeBank 则提供具有显式元数据(用于质量和置信度)的受控长期记忆。
-
新型外骨骼通过扭矩反馈学习顺应性机器人策略
研究人员开发了通用操作外骨骼(UME),这是一种低成本、轻量级的上肢外骨骼,用于收集力和扭矩数据。该系统提供实时触觉扭矩反馈,使人类操作员能够远程操作各种机器人,包括OpenArm、Franka和X-ARM。收集到的数据有助于在约束环境中学习复杂操作任务的顺应性全身策略。
-
新的基准和接口推动了双臂机器人操作的发展
研究人员推出了 DuoBench,这是一个用于评估双臂机器人操作的新框架,该框架在模拟和部分真实世界中实现。该基准包括十一个任务和一个新颖的评估方案,用于详细的故障分析,揭示了当前策略在复杂的双臂协调方面存在困难。另外,YUBI 接口已被开发出来,它具有一个可屈服的、由手指驱动的夹持器,旨在为双臂任务提供更直观和符合人体工程学的数据收集。与 UMI 等现有系统相比,YUBI 在灵活性和效率方面具有优势,能够创建一个大规模数据集,使策略…
-
ActionMap 通过体素热图改进机器人策略学习
研究人员开发了 ActionMap,这是一种新颖的体素热图动作头,旨在改进视觉-语言-动作 (VLA) 模型中的机器人策略学习。这个新的动作头取代了传统的动作解码器,在动作空间上预测热图,以更好地利用动作的几何邻近性。在模拟和真实世界测试中,ActionMap 与现有方法相比表现出更优越的性能和数据效率,表明动作表示是 VLA 模型有效性的关键因素。