PulseAugur
实时 11:37:18
实体 Scene Graphs

Scene Graphs

PulseAugur coverage of Scene Graphs — every cluster mentioning Scene Graphs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 5
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_118130 ·

    新的CoSPlan基准挑战视觉规划任务中的视觉语言模型

    研究人员推出了CoSPlan,这是一个旨在评估视觉语言模型(VLM)在视觉领域顺序规划能力的新基准。与基于文本的规划不同,CoSPlan要求模型执行一系列视觉动作,检测错误步骤并进行纠正以达到目标场景。尽管采用了思维链(Chain-of-Thought)和场景图(Scene Graphs)等高级策略,VLM在CoSPlan上仍面临挑战。为解决此问题,该论文提出了场景图增量更新(SGI),一种无需训练的方法,可优化文本场景图以进行分步推…

  2. RESEARCH · CL_117451 ·

    新的SIR方法通过场景图增强机器人学习的可解释性

    研究人员开发了一种名为结构化图像表示(SIR)的新方法,以提高机器人学习的可解释性。SIR利用场景图作为中间表示,从图像特征构建图,然后对其进行稀疏化以创建与任务相关的子图以生成动作。这种方法不仅提高了可解释性,而且在RoboCasa基准测试中也表现出优越的性能,成功率达到19.5%,而基于图像的基线为14.81%。学习到的稀疏图还可以作为分析模型行为和识别数据集偏差的宝贵工具。

  3. TOOL · CL_79763 ·

    新修剪方法提升LLM三维空间推理能力

    研究人员开发了CAPruner,一种用于修剪场景图以增强大型语言模型三维空间推理能力的新方法。现有的修剪技术常常会移除与任务相关的信息,但CAPruner整合了模糊语义相关性和空间邻近性,以识别和保留关键关系。该方法无需昂贵的关联级别标注即可进行训练,显著提高了LLM在三维视觉-语言任务上的性能。

  4. TOOL · CL_66271 ·

    机器人通过场景图记忆更好地学习任务

    研究人员开发了一种新的机器人模仿学习方法,该方法利用场景图来增强其对时空上下文的理解。这种方法有助于机器人在部分可观察的环境中保留相关的历史信息并进行长期任务推理。在模拟和真实世界操作任务中的实验表明,策略性能和泛化能力得到了显著提高。

  5. TOOL · CL_63098 ·

    手术AI场景图谱综述强调数据鸿沟,提出新验证方法

    对52项关于手术场景图谱的研究进行的范围审查显示,相关研究显著增加,并明显转向了基础模型和生成式AI模型。然而,“数据鸿沟”依然存在,大多数研究使用真实内窥镜视频,而外部手术室建模则依赖于模拟。该审查提出了一种新的“验证三位一体”框架,以解决当前计算机视觉指标与这些神经符号AI系统临床验证需求之间的差距。