RGB cameras
PulseAugur coverage of RGB cameras — every cluster mentioning RGB cameras across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
门控融合在HARMES数据集多模态活动识别中领先
研究人员使用HARMES数据集对七种多模态人类活动识别的传感器融合技术进行了比较研究。研究发现,门控多模态融合取得了最高的性能,宏F1分数达到0.82。该方法比基线基于拼接的晚期融合高出6个百分点。实验代码已在GitHub上公开。
-
新的FEMOT数据集和FEMOTR框架推动多目标跟踪技术发展
研究人员推出了FEMOT,这是一个新的数据集,旨在利用标准的RGB相机和受生物启发的事件相机来推进多目标跟踪。该数据集旨在通过利用事件相机的高时间分辨率和动态范围,克服传统相机在运动模糊和弱光等挑战性条件下的局限性。配套的FEMOTR框架有效地融合了两种相机类型的特征,以改进目标定位和跟踪。
-
新型紧凑型模型集成多项自动驾驶感知任务
研究人员开发了一种新型紧凑型深度学习模型,用于自动驾驶,可同时执行多项感知任务。该模型在一个前向传播中集成了语义分割、深度估计、LiDAR分割和鸟瞰图投影。它利用自适应损失加权算法来解决跨任务的失衡学习问题,并融合来自RGB摄像头、动态视觉传感器和LiDAR的数据,以实现全面的环境理解。该模型以更少的参数展示了卓越的性能,从而实现了更快的推理速度和更低的GPU内存使用量,并在模拟和真实世界数据集上取得了持续一致的结果。
-
新方法解决二维三维跨模态步态识别问题
两篇新的研究论文介绍了跨模态步态识别的新方法,旨在提高在二维摄像头和三维激光雷达等不同传感模态下识别个体的能力。DiffCrossGait 利用潜在扩散模型在根本上对齐步态轨迹,而不仅仅是最终的嵌入,从而促进模态不变的特征。TCFDNet 采用文本引导特征解耦,利用大型语言模型生成步态模式的语义描述,并对齐视觉和文本特征以实现更鲁棒的识别。
-
RadarSim 使用摄像头数据提高雷达模拟精度
研究人员开发了 RadarSim,这是一种新颖的可微分渲染器,它利用 RGB 摄像机的高角分辨率来模拟多普勒雷达测距图像。该方法从摄像头数据初始化神经场,与仅使用雷达的重建方法相比,能够生成更清晰的几何形状和更详细的雷达测距帧。该系统使用新的校准雷达-摄像头录制数据集进行了验证,证明了其在提高雷达模拟方面的有效性。
-
基于事件的摄像头提高了击球影响估算的准确性
研究人员开发了一个新的框架,使用基于事件的摄像头来准确估算击球影响的时间。该方法通过提供微秒级分辨率和高动态范围,解决了传统RGB摄像头和IMU的局限性。该系统生成高密度事件帧,并采用带有新颖损失函数的掩码细化网络来提高分割精度,在真实数据集上实现了平均绝对误差63%的降低。
-
事件相机利用眼动动力学以95%的准确率检测活体
研究人员探索了使用事件相机进行人脸活体检测,重点关注眼动动力学。与传统RGB相机不同,事件相机以高时间分辨率捕获异步亮度变化,能够精确分析扫视等眼球运动。这些相机能够区分真实和重放序列,因为重放攻击难以复制自然的眼动动力学,从而产生可检测的时空模式。该研究使用脉冲卷积神经网络实现了高达95.37%的准确率,表明其在鲁棒性和低延迟活体检测方面具有潜力。
-
发布新数据集“ParkingScenes”用于自动泊车研究
研究人员发布了ParkingScenes,一个旨在改进自动泊车系统的新型多模态数据集。该数据集使用CARLA模拟器构建,包含结构化泊车轨迹以及来自多个摄像头和深度传感器的同步传感器数据。它包含16个倒车入库和6个平行泊车场景,并考虑了行人存在情况下的变化,总计704个回合。与非结构化数据相比,该数据集旨在为基于学习的泊车策略提供更好的监督。