PulseAugur
实时 07:25:12
实体 RGB-D Visual Simultaneous Localization and Mapping (SLAM) Application

RGB-D Visual Simultaneous Localization and Mapping (SLAM) Application

PulseAugur coverage of RGB-D Visual Simultaneous Localization and Mapping (SLAM) Application — every cluster mentioning RGB-D Visual Simultaneous Localization and Mapping (SLAM) Application across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 32
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 32
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. TOOL · CL_223386 ·

    DINOcular框架从RGB-D数据中学习视觉空间表示

    研究人员推出DINOcular,一个新颖的自监督框架,旨在从RGB-D(彩色和深度)数据中学习视觉空间表示。该方法将源自深度信息的几何先验与视觉骨干相结合,使模型能够编码外观和空间结构。DINOcular在3D几何基准测试中表现出改进的性能,并在RGB-D数据的语义分割任务中保持竞争力。

  2. TOOL · CL_216191 ·

    Stream3Dv2框架通过几何语义融合增强零样本3D场景理解

    研究人员开发了Stream3Dv2,一个用于鲁棒、零样本3D场景理解的新型框架,采用流式RGB-D输入。这种无需训练的方法通过采用嵌套的局部到历史架构和几何语义融合机制,解决了处理序列数据和2D分割掩码中的噪声的局限性。Stream3Dv2将3D分割表述为点集合并问题,并使用基于流形距离的细化来改善边界描绘。实验表明,它在流式3D分割和检测方面优于现有方法,并且可以与基于LLM的代理集成,以实现更高级的语言驱动3D场景理解。

  3. TOOL · CL_208652 ·

    新的S3AM框架增强了多模态显著目标检测

    研究人员开发了S$^3$AM,一种用于多模态显著目标检测的新型单流框架。该方法将可靠性校准频率适配器与Segment Anything Model (SAM)骨干网络集成,以减少计算冗余。该框架采用频率专家混合和双门控校准机制,选择性地在Transformer阶段传播校准后的残差信息,而超网络引导的解码器则结合了语义掩码特征和基于Mamba的结构细节恢复。实验表明,S$^3$AM在可训练参数数量显著减少的情况下,实现了具有竞争力的性能。

  4. TOOL · CL_198279 ·

    新系统InViStream解决了实时体积视频中的隐私问题

    研究人员开发了InViStream,一个旨在保护实时体积视频流隐私的新颖系统。与传统视频不同,体积视频从多个角度捕捉3D场景,使得隐私擦除更加复杂。InViStream通过在数据融合之前从源头移除私有对象和内容来解决这个问题,防止在重建的3D表示中发生隐私泄露。该系统结合了对象检测和深度感知掩蔽,并确保跨校准视图的一致隐私决策,在合成和真实世界场景中都实现了高精度,同时保持实时流媒体速度。

  5. TOOL · CL_196219 ·

    新的GESTO记忆系统使机器人能够推理人类活动

    研究人员推出GESTO,一种专为在动态人类环境中运行的机器人设计的新型时空记忆系统。GESTO集成了持久的4D场景图与原子化人机交互和目标驱动事件的层次结构。该系统从RGB-D数据中自动提取带时间戳的交互,将其关联到场景实体,并将它们分组为事件,进而完善对象关联。然后,一个关系感知代理可以查询此记忆以进行活动中心推理,在现有基准和事件及空间推理的新查询上均表现出改进的性能。

  6. TOOL · CL_193596 ·

    新型能量结构化世界模型增强了物理一致的运动规划

    研究人员开发了一种新颖的能量结构化潜在世界模型(ELWM),以改进具身AI中物理一致的运动规划。该模型在其潜在状态中显式编码能量和动量,通过因果转换确保遵守现实世界动力学。当与用于导航策略的物理条件神经时间场(PC-NTF)集成时,ELWM与现有方法相比,显著减少了运动预测误差和碰撞率,同时提高了导航成功率和路径长度效率。

  7. TOOL · CL_191414 ·

    GOPI框架改进了从单视图图像进行3D家具插入

    研究人员开发了GOPI,一个新颖的框架,用于从单视图RGB-D图像生成合理的3D家具姿态,以插入室内场景。该方法通过结合数据驱动的3D放置迭代推理和几何引导的图像生成策略,解决了单视图2D图像条件固有尺度不确定性的问题。这种方法确保了合成图像与底层3D几何之间的连贯性,从而实现了更具几何可行性的物体放置和稳定的投影-生成对齐。

  8. TOOL · CL_178539 ·

    新的FOCUS框架提升了多模态大语言模型的显著目标检测能力

    一篇新研究论文提出FOCUS,一个旨在增强多模态大语言模型(MLLMs)显著目标检测(SOD)能力的新颖框架。该论文介绍了SaliLLM,一个诊断性基准,揭示了MLLMs在定位方面表现出色,但在分割方面存在困难,这主要是由于前景基数、粒度和范围的不匹配。FOCUS利用受格式塔启发的协同注意力和贝叶斯惊喜校准来解决这些限制,在无需特定任务训练的情况下,在各种SOD基准测试中取得了显著的性能提升。

  9. RESEARCH · CL_174218 ·

    新研究解决了可穿戴机器人的可供性分割问题 · 跟踪2个来源

    两篇研究论文探讨了在嵌入式设备上改进视觉可供性分割的方法,特别是针对可穿戴机器人。第一篇论文侧重于增强轻量级神经网络的解码器模块,以平衡泛化性能与计算成本。第二篇论文介绍了使用RGB-D摄像头和硬件感知神经架构搜索的方法,以在性能和硬件约束之间实现帕累托最优,并在电池兼容的能源预算内展示了实时能力。

  10. TOOL · CL_160999 ·

    新的感知管线旨在实现采矿岩石破碎机的自动化

    研究人员开发了一种实时RGB-D感知管线,用于自动化采矿中液压破碎锤(通常称为岩石破碎机)的操作。该系统集成了基于图像的实例分割和几何点云处理,以生成可行的岩石破碎姿态和工作空间的3D表示。该管线运行速度约为10 Hz,延迟低,专为嵌入式硬件设计,旨在提高二次破碎任务的效率,特别是在目前主要依靠远程操作的地下采矿中。

  11. TOOL · CL_154245 ·

    Seg2Grasp流水线通过模块化方法增强机器人料箱抓取能力

    研究人员开发了Seg2Grasp,一种用于料箱抓取任务的鲁棒吸盘抓取新型模块化流水线。该系统采用三步流程:使用基于Transformer的模型进行分割以创建物体掩码;基于表面法线和掩码提议进行抓取以确定最佳吸盘点;以及使用Mask-CLIP进行分类以识别物体。实验表明,Seg2Grasp在成功率和工业应用适应性方面优于现有方法。

  12. RESEARCH · CL_154690 ·

    AlayaWorld 以 720p 生成能力推动交互式视频世界建模

    研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…

  13. RESEARCH · CL_154244 ·

    DA-Fusion Transformer 提升未见物体分割能力,助力物流业

    研究人员开发了DA-Fusion,一种新颖的Transformer模型,它利用可变形注意力来融合RGB和深度数据,以改进未见过的物体实例分割。这项进展对于物流自动化任务(如箱式抓取和货架式抓取)尤其有益,因为在这些任务中,在混乱环境中精确识别物体至关重要。该团队还引入了物体混乱箱数据集(Object Clutter Bin Dataset, OCBD)来评估这些场景下的性能基准,证明了DA-Fusion在准确性方面优于现有方法。

  14. TOOL · CL_152106 ·

    研究发现:深度数据可提升手术视觉基础模型性能

    一项新研究探讨了在手术视觉基础模型中融入深度信息的影响。研究发现,使用RGB-D数据(如MultiMAE)进行预训练的模型,在各种手术任务上的表现显著优于仅使用RGB数据训练的模型。这种几何感知预训练还展现了卓越的数据效率,经过少量数据微调的模型超越了在完整数据集上训练的纯RGB模型。研究表明,多模态预训练是开发更强大的手术视觉系统的一条有前景的途径,且无需改变推理架构。

  15. RESEARCH · CL_139215 ·

    新的TACTIC控制器通过触觉和视觉数据增强全臂操作

    研究人员开发了TACTIC,这是一种专为涉及复杂接触动力学的全臂操作任务设计的新型控制器。该系统集成了RGB-D视觉、分布式触觉传感和近场表示,以创建混合预测模型。TACTIC将学习到的潜在动力学模型与分析运动学相结合,使其能够预测未来的接触配置和相互作用力,从而实现更鲁棒的控制。

  16. RESEARCH · CL_139267 ·

    GenVid2Robot框架将生成的视频运动转化为可执行的机器人轨迹

    研究人员开发了GenVid2Robot框架,该框架将生成的视频运动转化为可执行的机器人操作轨迹。该系统通过确保物理可执行性、度量几何和抓取接地,解决了直接将生成视频用于机器人技术的局限性。GenVid2Robot验证视频运动与真实世界观察的几何一致性,并将其应用于机器人抓取,提高了视频引导操作的可靠性。

  17. RESEARCH · CL_139321 ·

    SplatCtrl框架可在动态环境中实现反应式机器人控制

    研究人员开发了SplatCtrl,一个将实时场景重建与反应式机器人运动生成相结合的新框架。该系统使用3D高斯飞溅(3D Gaussian Splatting)从RGB-D流中高效构建动态环境的3D模型。然后,它从这些表示中导出连续符号距离函数,以估计碰撞概率,这些概率被输入到控制屏障函数中,以在先前未见过或不断变化的环境中实现安全平稳的机器人手臂运动。

  18. TOOL · CL_129539 ·

    Utonia:统一的3D点云编码器推动感知与推理

    研究人员推出了Utonia,这是一种新颖的自监督点变换器编码器,旨在处理来自不同领域的各种3D点云数据。这种统一的方法旨在创建一个能够理解来自遥感、LiDAR、RGB-D序列甚至纯RGB视频等来源数据的单一模型。通过在这些不同的领域学习一致的表示空间,Utonia展示了改进的感知能力,并推动了具身和多模态推理的进步,造福于机器人和视觉语言模型中的应用。

  19. RESEARCH · CL_131657 ·

    Image2Sim框架为AI导航训练生成逼真的3D环境

    研究人员开发了Image2Sim,一个用于为具身导航训练创建逼真且交互式3D环境的新颖框架。该系统利用解耦的3D空间锚定和照片级真实感渲染技术,从RGB-D图像生成高保真场景。Image2Sim可以合成数百万个导航训练样本,使仅在这些神经环境中训练的模型能够取得显著改进,并有效地迁移到现实世界场景。

  20. TOOL · CL_119690 ·

    新的LINet架构可在RGB-D场景分类中实现连续跨模态学习

    研究人员推出了一种新颖的多流神经网络(MSNN),名为LINet,用于RGB-D场景分类。与现有离散融合特征的架构不同,LINet在每一层都采用连续集成方法,使用线性集成卷积(LIConv2d)算子。该方法通过特定的常数初始化解决了初始化问题,并使用渐进式模态丢弃来防止训练过程中的通路崩溃。在SUN RGB-D上训练时,LINet在ResNet18规模下达到了45.2%的平均类别准确率,使用ScanNet预训练后提高到49.6%。