PulseAugur
实时 12:12:46
实体 Calvin

Calvin

PulseAugur coverage of Calvin — every cluster mentioning Calvin across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 6
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_152081 ·

    新框架利用外心数据改进内心3D手部姿态预测

    研究人员开发了Exo2EgoPose,一个旨在改进内心3D手部姿态预测的新颖框架。该方法利用外心演示来指导和补偿内心视图中通常存在的有限和动态的视觉线索。通过结合双层外心重建模块和全局到局部调制模块,Exo2EgoPose重建了分层外心表示,以逐步优化内心特征,从而实现更准确的预测。在多个基准上的实验表明,与现有方法相比有了显著改进,并显示出向人机转移的潜力。

  2. TOOL · CL_158838 ·

    新的Anchor-Align方法提升VLA策略泛化能力

    研究人员推出了一种名为Anchor-Align的新方法,通过解决标准行为克隆(BC)微调的问题来改进视觉-语言-动作(VLA)策略。BC微调可能会降低预训练视觉-语言模型(VLM)的泛化能力。Anchor-Align通过两个目标增强BC:视觉-语言锚定,它使用来自冻结VLM的蒸馏来保留表示;以及语言-动作对齐,它在同一观察下联合训练语言和动作预测。这种方法在真实机器人成功率以及在模拟和物理xArm7机器人上的各种扰动鲁棒性方面都显示出显著的改进。

  3. RESEARCH · CL_139583 ·

    新方法增强VLM到VLA的适应性以实现机器人控制 · 跟踪2个来源

    两篇新的研究论文提出了将视觉语言模型(VLM)适配为机器人视觉语言动作(VLA)模型的方法。第一篇论文介绍了CLAP(因果语言-动作预测),它将自然语言描述添加到动作序列中,以在微调过程中保持VLM的能力。第二篇论文Anchor-Align使用表示锚定和语言-动作对齐来防止预训练表示被覆盖并提高泛化能力。两种方法在机器人基准测试和物理机器人测试中都显示出显著的改进。

  4. TOOL · CL_129569 ·

    ThinkProprio 整合机器人状态以提升 VLA 模型注意力和速度

    研究人员开发了一种名为 ThinkProprio 的新方法,用于视觉-语言-动作 (VLA) 模型,该方法将本体感觉数据更有效地整合到决策过程中。与将状态信息视为后期条件信号的传统方法不同,ThinkProprio 将本体感觉离散化为 token,从而主动引导 VLA 模型对相关视觉信息的注意力。该方法在 CALVIN、LIBERO 和真实世界操作任务等各种基准测试中都表现出更高的性能和更低的推理延迟。

  5. RESEARCH · CL_79453 ·

    新基准和框架推动视频世界建模发展

    研究人员推出了“ImageTime”,这是一个旨在评估图像生成模型理解和表示时间变化能力的新基准。该基准通过要求模型生成一个动作的四个有序关键状态来评估时空一致性,超越了单一图像质量指标。此外,还开发了一个名为BiWM的新框架,利用双向自回归来推进开源交互式视频世界模型,旨在提高生成质量和推理速度。另一篇论文提出了一种用于视频世界模型的“潜在空间记忆”,将场景信息直接存储在扩散潜在空间中,从而显著加快生成速度并减小内存占用。

  6. TOOL · CL_29269 ·

    新的MoLA方法将机器人视频想象与动作执行相结合

    研究人员开发了一种名为MoLA(潜在动作混合)的新方法,通过更好地利用预测的未来视频帧来改进机器人操作。MoLA采用预训练的逆动力学模型混合,将这些想象的未来转化为可执行的动作。该方法捕捉各种视觉线索以推断物理上合理的动作,从而弥合了视频生成与策略执行之间的差距。在模拟和真实世界任务上的评估表明,MoLA提高了任务成功率、时间一致性和泛化能力。