Cityscapes
PulseAugur coverage of Cityscapes — every cluster mentioning Cityscapes across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
CoopNet or similar methods will be adapted for real-time autonomous driving perception stacks
CoopNet's success in improving self-supervised depth, odometry, and optical flow on datasets like Cityscapes indicates its potential for real-world applications. Given the critical nature of these predictions in autonomous driving, it's plausible that CoopNet or techniques like it will be integrated into perception systems for improved robustness and accuracy in dynamic environments.
Cityscapes benchmark sees increased focus on multi-task dense prediction frameworks
Recent evidence shows multiple papers (CoopNet, B3-Net) leveraging the Cityscapes dataset to improve dense prediction tasks like depth estimation and segmentation. This suggests a growing trend in using Cityscapes to test and validate frameworks that handle multiple, related pixel-level predictions simultaneously.
Unsupervised and self-supervised methods are achieving competitive performance on Cityscapes
The recent papers on unsupervised road segmentation and CoopNet's self-supervised approach highlight a strong trend. These methods are achieving high scores on the Cityscapes benchmark, indicating that supervised approaches may no longer be the sole path to state-of-the-art performance for tasks like segmentation and depth estimation.
Cityscapes benchmark is a common testbed for efficient semantic segmentation models
Multiple recent papers (FoR-Net, DGM-Net) utilize the Cityscapes benchmark to demonstrate the effectiveness of their efficient semantic segmentation architectures. This suggests a trend where researchers are using Cityscapes to validate models that perform well under computational constraints, indicating its importance for evaluating resource-efficient AI.
Cityscapes benchmark to see increased focus on hazard-aware scene generation
Recent research highlights hazard-aware traffic scene graph generation for autonomous vehicles. Given Cityscapes' role as a benchmark for semantic segmentation and related tasks, it's plausible that future research will increasingly incorporate hazard identification and awareness directly into scene generation or segmentation evaluations on this dataset.
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
Haar之外的小波基团可提高AI模型的效率
研究人员探索了除常用的Haar和小波之外的不同小波基团在小波卷积层中的有效性。他们的研究侧重于滤波器长度和分解级别之间的权衡,发现像Coiflets这样具有更强近似特性的基团,与Haar相比,可以用更少的参数和FLOPs实现具有竞争力的准确性。这表明替代小波基团为构建基于小波的架构的实践者提供了更高效的设计选择,特别是在图像分类和语义分割任务中。
-
新V-JEPA4A模型增强自动驾驶视频分析能力
研究人员开发了V-JEPA4A,这是一种专为自动驾驶应用设计的新型自监督学习模型。该模型采用了一种新颖的显著性驱动掩码策略,优先处理驾驶视频中在语义和时间上相关的信息,这与之前使用随机掩码的方法不同。在BDD100k MOT、Cityscapes和KITTI-2015等基准测试中,V-JEPA4A在目标跟踪和深度估计等任务上表现出显著的改进,同时仅略微增加了预训练时间。
-
V-RAE 通过使用冻结的语义表示来推进视频生成
研究人员推出了 V-RAE,这是一种新颖的视频表示自编码器,旨在改进潜在视频生成。与优化像素级重建的先前模型不同,V-RAE 使用冻结的视觉基础模型表示来构建紧凑的生成潜在表示。这种方法有效地消除了时间冗余,同时保留了语义结构,从而在视频重建、生成和预测任务中取得了卓越的性能。V-RAE 在 K600 和 UCF101 等基准测试中取得了最先进的成果,证明了语义表示对于有效的视频生成建模至关重要。
-
Semantic Prism 框架提升生成式语义分割精度
研究人员推出了一种新颖的生成式语义分割框架 Semantic Prism,旨在提高结构化预测的准确性和可靠性。该方法利用扩散蒸馏生成器渲染语义 RGB 图像,并采用基于像素到颜色代码本距离的概率接口。通过对齐多级生成器特征并预测残差调整,Semantic Prism 增强了最终分布的参考,并引入了一种称为上下文接口-层级不一致 (C-IHD) 的方法,无需额外预测器即可对像素误差进行排名。
-
新基准和方法推动视频生成模型评估
研究人员推出了 VGI-BENCH,这是一个旨在评估视频生成模型视觉智能的新基准。该基准包含 27 个任务和 810 个实例,旨在评估超越仅生成逼真最终帧的推理能力。初步评估显示,即使是 Seedance 2.0 等先进模型也只能达到 51.0% 的准确率,这表明在内部错误纠正和对输入条件的敏感性等方面仍有很大的改进空间。同时,提出了一种名为 V-RAE 的新方法,该方法利用冻结的视觉表示来创建用于视频生成的语义组织潜在空间,从而实现…
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…
-
StaticSegFormer 提升语义分割效率且不损失性能
研究人员开发了 StaticSegFormer,这是一种新颖的静态结构化剪枝方法,旨在提高深度神经网络在语义分割任务中的效率。该方法专门针对 SegFormer 网络中的注意力层,目标是在不牺牲性能(mIoU)的情况下降低计算复杂度(FLOPs)并提高帧率(fps)。在 ADE20K 和 Cityscapes 基准测试上的实验表明,在 Cityscapes 上 fps 显著提高了高达 34%,而 mIoU 没有下降,尤其有利于较小的编…
-
新的 iFAN 框架提高了掩码 Transformer 的图像分割精度
研究人员开发了一个名为推理感知学习 (iFAN) 的新训练框架,旨在提高用于图像分割的普通掩码 Transformer 的性能。iFAN 解决了两个关键问题:高概率分数与实际掩码质量之间的不匹配,以及中间层可能丢失的优越预测。通过结合调整概率-掩码排序 (APMR) 和跨层自蒸馏 (CLSD),iFAN 在各种数据集和架构上提高了分割精度,同时对计算资源的影响最小。
-
InstancePin 扩散模型增强了实例级图像生成控制
研究人员开发了 InstancePin,一个新颖的扩散模型框架,旨在提高从布局输入生成图像时的实例级控制能力。与之前的类别对齐模型不同,InstancePin 将每个对象实例显式地锚定在坐标标记上,从而能够对单个对象进行更精细的控制,尤其是在城市环境等密集场景中。该框架使用实例感知适配器和坐标固定注意力来保持全局语义一致性,同时优化局部实例细节,实验表明其保真度有所提高,实例纠缠有所减少。
-
新方法增强了对语义分割模型的对抗性攻击
研究人员开发了IGME,一种为语义分割模型生成可迁移对抗性扰动的有效方法。该方法使用单个源模型来组合攻击组件,共享梯度计算以降低成本。IGME采用集成梯度风格的路径平均方向来稳定更新,并在CNN和Transformer模型上展示了与现有方法相比具有竞争力的可迁移性和运行时效率。
-
JEPADepth 框架增强了自监督单目深度估计
研究人员开发了 JEPADepth,一种新颖的自监督单目深度估计框架,它整合了受 Image Joint-Embedding Predictive Architectures (I-JEPA) 启发的掩码预测表示学习目标。该方法在 DINOv3 Vision Transformer 编码器的表示空间中,用预测损失增强了传统的光度损失。该方法在 KITTI、Make3D 和 Cityscapes 等标准基准测试中,与最先进的基于 Tra…
-
新 Bootleg 方法增强了 AI 模型自监督学习能力
研究人员开发了一种名为 Bootleg 的新自监督学习方法,旨在结合生成方法的稳定性和预测方法的效率。Bootleg 训练模型从教师模型的多个隐藏层预测潜在表示,使其能够同时捕获不同抽象级别的特征。在分类和语义分割的多个基准数据集上,这种方法显示出比 I-JEPA 等现有方法显著的改进。
-
优化RetinaNet架构实现汽车系统的实时语义分割
研究人员开发了一种名为Opt-RetinaSeg的优化语义分割架构,该架构源自RetinaNet检测框架,专门用于嵌入式汽车系统的实时感知。该新架构采用轻量级特征提取器、重构的特征金字塔网络和紧凑的分割头。通过剪枝、量化和知识蒸馏等三阶段优化过程,Opt-RetinaSeg与基线模型相比实现了显著的速度提升和尺寸减小,同时精度损失极小,使其适用于资源受限的汽车硬件。
-
EGRNet:具有边缘细化功能的轻量级语义分割网络
研究人员开发了EGRNet,这是一种用于城市环境中实时语义分割的轻量级深度学习模型。该网络利用深度可分离卷积和膨胀残差块来有效捕获多尺度上下文信息。新颖的边缘门控细化模块增强了边界保持能力,而Squeeze-and-Excitation注意力机制则改善了特征表示。EGRNet仅拥有0.46百万个参数,在Cityscapes数据集上实现了65.28%的mIoU,并包含一个轻量级的对抗攻击检测策略以提高鲁棒性。
-
新方法通过视图合成和遮挡感知推进全景分割 · 跟踪 2 个来源
研究人员正在开发全景分割的新方法,这项任务涉及识别和描绘图像中的每个对象实例和语义区域。一种方法利用大型视图合成模型将全景标签传播到新视图,而无需显式 3D 重建,在 ScanNet 和 Replica 等数据集上取得了有竞争力的结果。另一种方法 PEMOLA 为基于 Transformer 的分割引入了一个遮挡感知的模块,利用 COCO-OLAC 和 Cityscapes-OLAC 等数据集的遮挡线索来提高性能,尤其是在遮挡场景中。
-
DPNeXt框架通过高效的ViT融合提升多任务密集预测性能
研究人员推出了一种新颖的框架DPNeXt,旨在增强机器人感知中密集预测任务的多任务学习。该轻量级系统可高效融合来自Vision Foundation Models的多尺度特征,为Dense Prediction Transformer提供了一种替代方案。DPNeXt采用了一种多任务边界引导策略,无需额外的标注成本即可确保几何一致性。在Cityscapes和NYUv2数据集上的实验表明,与现有模型相比,DPNeXt在可训练参数更少、推理…
-
受生物启发的预处理增强了AI模型对光照变化的鲁棒性
研究人员开发了一种新颖的预处理模块,该模块受到人眼视网膜的启发,旨在增强深度神经网络在面对光照和天气条件变化等分布偏移时的鲁棒性。该方法结合了颜色重映射和局部对比度提取,以创建稀疏表征,强调结构特征,从而提高语义分割等任务的性能。该方法在保持分布内准确性的同时,显著提高了在具有挑战性的光照场景下的泛化能力,即使对比度表征的稀疏度高达70%。
-
新的ETBQ方法可提高低比特神经网络量化精度
研究人员开发了一种名为高效量化前调优(ETBQ)的新方法,以提高深度神经网络低比特训练后量化(PTQ)的精度。该技术包括一个预处理调优阶段,在PTQ过程之前优化全精度模型,使其对量化误差不那么敏感。ETBQ不需要训练假量化模型,因此计算效率很高。在ImageNet和Cityscapes等各种数据集上的实验表明,ETBQ在不同任务中显著提高了低比特PTQ的性能。