NYUv2
PulseAugur coverage of NYUv2 — every cluster mentioning NYUv2 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的BPGS方法增强了多任务学习的鲁棒性
研究人员开发了一种名为有界精度几何缩放(BPGS)的新方法,以改进多任务学习,尤其是在任务损失差异显著的情况下。BPGS通过有界sigmoid参数化映射每个任务的对数方差,将网络优化与不确定性优化解耦。在合成数据和真实世界基准(如NYUv2、Yeast和RF1)上的实验中,该方法比Kendall加权和Nash-MTL等现有方法更具鲁棒性,即使在损失尺度不匹配高达1000倍的情况下,性能下降也很小。
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
新的EMAN框架可在多任务学习中实现动态路径涌现
研究人员推出了一种新颖的多任务学习框架——涌现模块化原子网络(EMAN)。EMAN从单个计算路径开始,仅在持续的优化证据支持时才动态地生成新的、独立的路径。这种方法允许自适应地分配共享和任务特定的表示容量,以适应不同的任务需求。在PASCAL-Context和NYUv2数据集上的实验表明,EMAN在提高性能的同时保持了具有竞争力的计算成本。
-
YouTube-Occ 从网络视频中学习3D语义占用
研究人员开发了YouTube-Occ,一种从互联网视频预测3D语义占用的新方法,解决了标注3D室内数据稀缺的问题。该系统利用一个处理原始网络视频的流水线来估计相机几何、重建点云,并使用基础模型生成语义伪标签。为了提高性能,引入了一个具有双重对齐策略的预训练框架,包括用于3D到2D特征匹配的帧内对齐和用于语义一致性的跨场景对齐。这种方法在NYUv2和Occ-ScanNet基准测试中,尤其是在低数据场景下,展示了持续的性能提升。
-
PixelUp 通过零样本特征上采样增强视觉模型
研究人员开发了 PixelUp,一种用于上采样视觉基础模型 (VFM) 特征的新型零样本方法。该技术旨在通过恢复像素级细节来提高细粒度视觉任务(如语义分割和深度估计)的准确性。PixelUp 利用由多尺度语义特征引导的 VFM 不可知架构,其性能优于现有的上采样方法,并在 NYUv2 等基准测试中取得了最先进的成果。
-
GeoStereo框架利用扩散先验统一立体几何估计
研究人员推出了一种新颖的框架GeoStereo,它统一了用于视差和表面法线预测的立体几何估计。该方法利用扩散先验来增强在低光照条件、反射表面和透明物体等具有挑战性的视觉场景中的性能。GeoStereo将前馈立体匹配管道与基于扩散的法线估计分支相结合,使扩散模型能够提供改进视差估计的结构先验,反之亦然。该框架在KITTI和NYUv2等基准测试中在视差估计方面取得了最先进的结果,并在iBims-1和ScanNet等室内数据集上在法线预测方…
-
DPNeXt框架通过高效的ViT融合提升多任务密集预测性能
研究人员推出了一种新颖的框架DPNeXt,旨在增强机器人感知中密集预测任务的多任务学习。该轻量级系统可高效融合来自Vision Foundation Models的多尺度特征,为Dense Prediction Transformer提供了一种替代方案。DPNeXt采用了一种多任务边界引导策略,无需额外的标注成本即可确保几何一致性。在Cityscapes和NYUv2数据集上的实验表明,与现有模型相比,DPNeXt在可训练参数更少、推理…
-
LingBot-Vision 使用掩码边界建模进行自监督预训练
研究人员推出了一种新的自监督预训练方法LingBot-Vision,该方法专注于掩码边界建模。这种方法通过迫使模型重建特定的边界区域而不是随机斑块来提高性能。在评估中,LingBot-Vision 在NYUv2线性探测中取得了0.296的RMSE,优于DINOv3-7B,但在ImageNet分类和ADE20K分割任务上表现落后。该方法提供的权重有四种尺寸,采用Apache-2.0许可证。
-
蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成
蚂蚁集团凌波科技发布了一系列旨在推进具身AI和机器人技术的新模型。LingBot-VA 2.0被呈现为首个具身原生世界动作模型,从根本上为物理世界交互而设计,而非改编数字世界模型。与之相辅的是LingBot-World 2.0,一个能够进行长达一小时生成的实时交互式世界模型,并整合了AI代理机制以实现动态交互。此外,LingBot-Video,一个基于MoE的视频生成模型,针对具身AI任务进行了优化,在机器人基准测试中表现优于现有模型…
-
新框架ReLiF改进了多任务学习中的公平性评估
研究人员开发了一个名为ReLiF的新框架,以解决多任务学习(MTL)中Lipschitz公平性评估的问题。该框架引入了固定delta审计,它使用共享的参考容差来跨不同算法进行一致的比较。在临床和密集预测基准上的实验表明,ReLiF可以揭示可能被依赖于方法的阈值所掩盖的效用-公平性权衡。
-
SA4Depth 改进了自监督单目深度估计
研究人员推出 SA4Depth,这是一种增强自监督单目深度估计的新方法。该方法侧重于改进来自独立深度和姿态网络尺度的对齐,这是先前工作中经常被忽视的关键因素。通过重投影视觉特征和优化姿态估计,SA4Depth 在不增加推理时间的情况下确保了序列间一致的场景尺度预测。该技术无缝集成到现有流程中,并在 KITTI、Cityscapes 和 NYUv2 等基准数据集上显著提高了深度估计的准确性。
-
开源图像编辑器展现出惊人的零样本视觉能力
研究人员评估了三个开源图像编辑模型——Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit——在没有任何微调的情况下进行零样本视觉学习的能力。研究发现,这些模型在深度估计、表面法线估计和语义分割等任务上表现出显著的视觉理解能力。值得注意的是,FireRed-Image-Edit 在表面法线估计任务上的表现与一个指令微调模型相当,而 Qwen-Image-Edit 和 LongC…