Inverse-dynamics model eye movement control by Purkinje cells in the cerebellum
PulseAugur coverage of Inverse-dynamics model eye movement control by Purkinje cells in the cerebellum — every cluster mentioning Inverse-dynamics model eye movement control by Purkinje cells in the cerebellum across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新型机器人导航框架使用视觉线索和视频规划
研究人员开发了 CueNav,一个新颖的机器人导航框架,它利用视觉线索引导的视频规划,并结合了特定于具身的反动力学模型 (IDM)。该方法将未来观测预测为视频规划,整合了鸟瞰图 (BEV) 地图以提供全局上下文,并在机器人本体视角中保留部分机器人身体以提供具身上下文。然后,IDM 将这些视频规划中的密集流场转换为机器人动作,显著提高了在狭窄通道和迷宫等复杂环境中的导航成功率。
-
新的AI模型通过改进的记忆和规划能力推动机器人操作发展
研究人员开发了新的机器人操作方法,提高了在长时任务中的性能。2AM系统将任务记忆与动作模型分离,实现了更精确的控制,并在LIBERO-Mem数据集上比现有基线提高了61.5分。DUET-DINO是另一项进展,它使用同时跨视图世界建模来增强潜在规划,实现完整的7-DoF末端执行器控制,在到达任务上以高达92%的成功率超越了单视图模型。GE-Act 2.0专注于从头开始预训练和扩展世界-动作模型,通过更多的训练数据展示了显著的成功率提升,…
-
镜像学习框架利用第三人称数据增强模仿学习
研究人员引入了一个名为“镜像学习”的新颖框架,通过利用第三人称观察数据来增强模仿学习。该方法结合了一个由微调视频扩散模型驱动的学习视角转换和一个逆动力学模型来推断动作轨迹。该方法生成“镜像数据”,这是通过观察演示者行为合成的伪第一人称专家数据,即使没有直接的第一人称数据也能进行有效的策略训练。用这些镜像数据增强传统的行为克隆已被证明可以提高下游策略的性能,这表明生成式世界模型可以为数据收集提供一种可扩展且安全的选择,替代大量的远程操作。
-
新的LAVIFT框架增强了VLM中的手术交互识别能力
研究人员开发了LAVIFT,一种用于微调视觉语言模型(VLM)以更好地识别手术交互的新型框架。该方法通过使用逆动力学模型来捕捉由动作引起的可视变化,以及使用前向世界模型将编码器聚焦于相关的动作区域,来解决将VLM应用于细粒度手术任务的挑战。LAVIFT包含一个补丁级别的SIG正则化器,无需额外监督即可防止特征坍塌,从而在实验中提高了识别和图像-文本对齐能力。