Cityscapes
PulseAugur coverage of Cityscapes — every cluster mentioning Cityscapes across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
CoopNet or similar methods will be adapted for real-time autonomous driving perception stacks
CoopNet's success in improving self-supervised depth, odometry, and optical flow on datasets like Cityscapes indicates its potential for real-world applications. Given the critical nature of these predictions in autonomous driving, it's plausible that CoopNet or techniques like it will be integrated into perception systems for improved robustness and accuracy in dynamic environments.
Cityscapes benchmark sees increased focus on multi-task dense prediction frameworks
Recent evidence shows multiple papers (CoopNet, B3-Net) leveraging the Cityscapes dataset to improve dense prediction tasks like depth estimation and segmentation. This suggests a growing trend in using Cityscapes to test and validate frameworks that handle multiple, related pixel-level predictions simultaneously.
Unsupervised and self-supervised methods are achieving competitive performance on Cityscapes
The recent papers on unsupervised road segmentation and CoopNet's self-supervised approach highlight a strong trend. These methods are achieving high scores on the Cityscapes benchmark, indicating that supervised approaches may no longer be the sole path to state-of-the-art performance for tasks like segmentation and depth estimation.
Cityscapes benchmark is a common testbed for efficient semantic segmentation models
Multiple recent papers (FoR-Net, DGM-Net) utilize the Cityscapes benchmark to demonstrate the effectiveness of their efficient semantic segmentation architectures. This suggests a trend where researchers are using Cityscapes to validate models that perform well under computational constraints, indicating its importance for evaluating resource-efficient AI.
Cityscapes benchmark to see increased focus on hazard-aware scene generation
Recent research highlights hazard-aware traffic scene graph generation for autonomous vehicles. Given Cityscapes' role as a benchmark for semantic segmentation and related tasks, it's plausible that future research will increasingly incorporate hazard identification and awareness directly into scene generation or segmentation evaluations on this dataset.
-
新方法提升专业领域开放词汇语义分割能力
研究人员开发了两种新方法来增强专业领域的开放词汇语义分割(OVSS)。一种方法是偏好引导适应(Preference-Guided Adaptation),它利用提示不一致性生成偏好监督,在没有密集像素级标注的情况下适应模型。另一种方法是SegRAG,它采用检索增强空间提示(retrieval-augmented spatial prompting)和冻结的基础模型,构建一个类索引内存来指导分割。这两种技术在各种基准测试中都显示出显著的…
-
新的CA-RAG方法提高了语义图像通信效率
研究人员开发了一种名为信道自适应区域邻接图载体(CA-RAG)的语义图像通信新方法。该方法对图像内的区域级关系进行编码,从而在有限的信道资源下更有效地传输与任务相关的信息。CA-RAG利用了派生自分割的区域邻接图,其中节点存储属性,边保留邻接关系,并采用信道自适应图简化技术来控制节点预算。在Cityscapes数据集上,与现有方法相比,该系统在不同水平的加性白高斯噪声下表现出更高的语义一致性和相当的感知质量。
-
联网车辆利用AI进行态势感知以优化数据分发
研究人员通过增强态势感知,开发了一种用于联网车辆智能数据分发的新颖方法。该方法利用鸟瞰图图像、物体检测和语义分割来理解交通环境。该系统在CARLA模拟器上进行了评估,并在Cityscapes和nuScenes数据集上进行了验证,它根据当前的道路状况对相关传感器数据进行优先级排序,从而提高了数据管理效率。
-
新的FSPGD方法增强了对语义分割的黑盒攻击
研究人员开发了一种名为特征相似性投影梯度下降(FSPGD)的新方法,以改进对语义分割模型的黑盒对抗性攻击。该技术在特征空间中运行,破坏中间表示而不是仅破坏输出logits,这对于密集预测任务至关重要。在Pascal VOC 2012和Cityscapes等标准数据集上的实验表明,与现有方法相比,FSPGD实现了更高的可迁移性,并在用于对抗性训练时增强了模型鲁棒性。
-
新框架使人工智能能够对复杂数据集进行联合分类和回归
研究人员开发了一个增强的协同多任务语义通信(CMT-SemCom)框架,该框架旨在同时处理分类和回归任务。这项新论文详细介绍了这个先进的系统,它通过将该框架应用于复杂的Cityscapes数据集,超越了仅分类的简单任务,从而扩展了先前的工作。CMT-SemCom框架利用通用单元和专用单元来促进协同处理,研究人员采用了信息最大化原理来适应混合离散和连续的语义变量。评估表明,这种方法在性能上显著优于独立的单任务训练和传统的数字传输方法。
-
InsightSeg系统复用纠错洞察以改进分割
研究人员开发了InsightSeg,一个通过复用过去的纠错洞察来增强语义分割的新颖系统。这种情景记忆机制将成功的错误纠正过程转化为可复用的、视觉上可依据的洞察。这些洞察通过补丁级视觉概念向量锚定到特定的图像区域,然后与后续图像中的密集补丁嵌入进行匹配。这种方法将系统从反复纠错转变为预防错误,从而提高了Waymo和Cityscapes等数据集上的分割质量和效率。
-
新的源编解码器在低比特率下增强了分布式语义分割
研究人员开发了两种新颖的源编解码器,以提高分布式深度神经网络在语义分割中的率失真性能,尤其是在极低比特率下。这些编解码器能够实现边缘设备和云平台之间的有效传输,在ADE20K和Cityscapes数据集上实现了低于每像素0.2比特的最新结果。
-
GANs提升车联网图像传输性能
研究人员开发了一种新的基于生成对抗网络(GAN)的语义通信框架,旨在提高车联网(IoV)中图像传输的效率和保真度。该框架根据驾驶安全优先考虑语义信息,并据此分配比特和设计损失函数。该系统旨在从损坏的语义标签中重建高质量图像,在Cityscapes数据集上,即使在加性高斯白噪声和瑞利信道等挑战性信道条件下,也比现有方法表现出更优越的性能。
-
新框架利用扩散模型为城市语义分割生成低成本数据
研究人员开发了一个新颖的框架,该框架利用扩散模型为城市语义分割生成高保真、领域对齐的图像。该方法使用不完美的伪标签来使现成的扩散模型适应特定目标领域,例如 Cityscapes。该系统过滤掉次优生成,纠正图像-标签错位,并标准化语义,将弱合成数据转化为有效的训练集。实验表明,分割性能显著提高,快速构建的合成数据集在与需要大量手动设计的相比时具有竞争力。
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
Haar之外的小波基团可提高AI模型的效率
研究人员探索了除常用的Haar和小波之外的不同小波基团在小波卷积层中的有效性。他们的研究侧重于滤波器长度和分解级别之间的权衡,发现像Coiflets这样具有更强近似特性的基团,与Haar相比,可以用更少的参数和FLOPs实现具有竞争力的准确性。这表明替代小波基团为构建基于小波的架构的实践者提供了更高效的设计选择,特别是在图像分类和语义分割任务中。
-
新V-JEPA4A模型增强自动驾驶视频分析能力
研究人员开发了V-JEPA4A,这是一种专为自动驾驶应用设计的新型自监督学习模型。该模型采用了一种新颖的显著性驱动掩码策略,优先处理驾驶视频中在语义和时间上相关的信息,这与之前使用随机掩码的方法不同。在BDD100k MOT、Cityscapes和KITTI-2015等基准测试中,V-JEPA4A在目标跟踪和深度估计等任务上表现出显著的改进,同时仅略微增加了预训练时间。
-
V-RAE 通过使用冻结的语义表示来推进视频生成
研究人员推出了 V-RAE,这是一种新颖的视频表示自编码器,旨在改进潜在视频生成。与优化像素级重建的先前模型不同,V-RAE 使用冻结的视觉基础模型表示来构建紧凑的生成潜在表示。这种方法有效地消除了时间冗余,同时保留了语义结构,从而在视频重建、生成和预测任务中取得了卓越的性能。V-RAE 在 K600 和 UCF101 等基准测试中取得了最先进的成果,证明了语义表示对于有效的视频生成建模至关重要。
-
Semantic Prism 框架提升生成式语义分割精度
研究人员推出了一种新颖的生成式语义分割框架 Semantic Prism,旨在提高结构化预测的准确性和可靠性。该方法利用扩散蒸馏生成器渲染语义 RGB 图像,并采用基于像素到颜色代码本距离的概率接口。通过对齐多级生成器特征并预测残差调整,Semantic Prism 增强了最终分布的参考,并引入了一种称为上下文接口-层级不一致 (C-IHD) 的方法,无需额外预测器即可对像素误差进行排名。
-
新基准和方法推动视频生成模型评估
研究人员推出了 VGI-BENCH,这是一个旨在评估视频生成模型视觉智能的新基准。该基准包含 27 个任务和 810 个实例,旨在评估超越仅生成逼真最终帧的推理能力。初步评估显示,即使是 Seedance 2.0 等先进模型也只能达到 51.0% 的准确率,这表明在内部错误纠正和对输入条件的敏感性等方面仍有很大的改进空间。同时,提出了一种名为 V-RAE 的新方法,该方法利用冻结的视觉表示来创建用于视频生成的语义组织潜在空间,从而实现…
-
新的CW-BASS v2方法改进了基础模型下的半监督分割
研究人员开发了CW-BASS v2,一种用于半监督语义分割中伪标签选择的新方法。该方法旨在与DINOv2等具有饱和置信度水平的强大、自监督基础模型教师有效协同工作。CW-BASS v2使用一种饱和感知机制,通过在预留数据上校准教师的可靠性,采用严格过滤或自适应置信度下限来防止确认偏差并提高分割精度。
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…
-
StaticSegFormer 提升语义分割效率且不损失性能
研究人员开发了 StaticSegFormer,这是一种新颖的静态结构化剪枝方法,旨在提高深度神经网络在语义分割任务中的效率。该方法专门针对 SegFormer 网络中的注意力层,目标是在不牺牲性能(mIoU)的情况下降低计算复杂度(FLOPs)并提高帧率(fps)。在 ADE20K 和 Cityscapes 基准测试上的实验表明,在 Cityscapes 上 fps 显著提高了高达 34%,而 mIoU 没有下降,尤其有利于较小的编…
-
新的 iFAN 框架提高了掩码 Transformer 的图像分割精度
研究人员开发了一个名为推理感知学习 (iFAN) 的新训练框架,旨在提高用于图像分割的普通掩码 Transformer 的性能。iFAN 解决了两个关键问题:高概率分数与实际掩码质量之间的不匹配,以及中间层可能丢失的优越预测。通过结合调整概率-掩码排序 (APMR) 和跨层自蒸馏 (CLSD),iFAN 在各种数据集和架构上提高了分割精度,同时对计算资源的影响最小。
-
InstancePin 扩散模型增强了实例级图像生成控制
研究人员开发了 InstancePin,一个新颖的扩散模型框架,旨在提高从布局输入生成图像时的实例级控制能力。与之前的类别对齐模型不同,InstancePin 将每个对象实例显式地锚定在坐标标记上,从而能够对单个对象进行更精细的控制,尤其是在城市环境等密集场景中。该框架使用实例感知适配器和坐标固定注意力来保持全局语义一致性,同时优化局部实例细节,实验表明其保真度有所提高,实例纠缠有所减少。