PulseAugur
实时 08:16:09
实体 Ms Coco

Ms Coco

PulseAugur coverage of Ms Coco — every cluster mentioning Ms Coco across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 26
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_210469 ·

    新的DistScan框架可检测目标检测模型的后门

    研究人员开发了DistScan,一个用于检测目标检测模型后门的新型框架。该方法通过分析模型在干净数据上预NMS预测类别分布的偏移来识别恶意修改,这与正常训练频率不同。DistScan无需访问模型权重或了解触发器,并且在现有技术之上表现出色,尤其是在场景级攻击方面。

  2. TOOL · CL_206700 ·

    新方法提升体操极端姿势的AI姿态估计

    研究人员开发了一种方法来改进蹦床体操中的人体姿态估计,这项运动的特点是姿势极端且视角不寻常。通过结合真实的极端姿势和从动作捕捉录音生成的合成数据来微调ViTPose模型,他们实现了显著的准确性提升。这种方法弥合了挑战性姿势的性能差距,将平均每关节位置误差(MPJPE)降低了42.7%(3D)。

  3. TOOL · CL_206125 ·

    基于概念的可解释人工智能揭示深度神经网络的弱点和数据集偏差

    研究人员探索了使用基于概念的可解释人工智能(CXAI)方法来理解多标签图像分类中深度神经网络(DNN)的学习弱点和偏差。通过在 MS-COCO 数据集上训练 VGG16 和 ResNet50 模型,并应用 CRP 和 CRAFT 等 CXAI 技术,研究发现更高的概念区分度可以减少标签和概念中的混淆。分析还强调了数据集中环境概念如何暴露模型固有的偏差。

  4. TOOL · CL_204109 ·

    新的PROVE方法使用可验证证据恢复AI图像提示

    研究人员开发了PROVE,一种新颖的无训练方法,用于从文本到图像模型生成的图像中恢复文本提示。与依赖优化、字幕或强化学习的现有技术不同,PROVE通过直接从图像证据组合可验证的场景描述来重建提示。这种方法旨在通过提供基于显式视觉数据的可审计提示来解决版权和内容所有权问题。PROVE在多个数据集和生成器上,与当前基线相比,在图像相似性和文本-图像对齐方面表现出优越的性能,而无需任何训练或生成器访问。

  5. TOOL · CL_196223 ·

    新的PEAK框架可精确擦除文本到图像模型中的概念

    研究人员开发了PEAK,一个用于精确持久地擦除文本到图像扩散模型中概念的新框架。该方法利用k稀疏自编码器(kSAEs)将密集表示分解为可解释的稀疏特征。通过识别并选择性地抑制目标特定特征,同时保留其他特征,PEAK旨在防止意外的语义干扰和被擦除概念的对抗性恢复。实验表明,PEAK显著减少了敏感内容的检测,并保持了生成质量。

  6. TOOL · CL_194149 ·

    新型 Poly-DETR 模型连接物体检测与分割

    研究人员推出了一种新颖的方法——多边形检测 Transformer (Poly-DETR),它弥合了物体检测与分割之间的差距。该方法利用极坐标表示直接构建逼近轮廓的多边形,与传统的边界框或像素级掩码相比,提供了更紧凑、更准确的表示。Poly-DETR 与 DETR 类检测器无缝集成,并引入了极坐标可变形注意力 (Polar Deformable Attention) 和感知位置的训练方案 (Position-Aware Trainin…

  7. TOOL · CL_185529 ·

    DSeq-JEPA架构通过顺序预测增强视觉表示学习

    研究人员推出了一种新颖的自监督视觉表示学习架构DSeq-JEPA。该模型在基于图像的联合嵌入预测架构(I-JEPA)的基础上,通过引入判别式顺序预测过程。DSeq-JEPA首先关注重要的视觉区域,然后逐步预测后续区域,模仿人类的注意力。在图像分类和目标检测等多个基准测试中的实验表明,DSeq-JEPA比其前身学习到更鲁棒、更具泛化性的表示。

  8. TOOL · CL_181121 ·

    DeCLIP框架增强CLIP以实现多标签增量学习

    研究人员推出DeCLIP,一个新颖的框架,旨在通过解决CLIP模型的问题来改进多标签类别增量学习(MLCIL)。DeCLIP利用解耦提示来学习特定类别的正向和负向提示,这有助于匹配视觉-语言对并减少视觉表示的纠缠。这种方法旨在减轻灾难性遗忘,而无需数据重放。此外,DeCLIP还包含一种称为自适应相似度调节(Adaptive Similarity Tempering)的推理时策略,以减少部分标记场景中的误报。

  9. RESEARCH · CL_160948 ·

    新的基准和框架推动网络监督多标签图像识别

    研究人员推出了一种新的网络监督多标签识别基准,该领域使用免费的网络图像来训练深度学习模型,从而减少了对昂贵手动标注的需求。该基准名为 Web-COCO 和 Web-Pascal,包含约 300,000 张图像,旨在标准化多标签识别任务的评估协议。除了基准之外,研究团队还提出了一个双分支多标签对比学习 (DBMLCL) 框架,该框架在识别和纠正噪声标签方面表现出卓越的性能。

  10. RESEARCH · CL_141612 ·

    新研究解决多模态学习中的模态鸿沟和鲁棒性问题

    两篇新研究论文探讨了通过解决模态鸿沟和鲁棒性挑战来改进多模态学习的方法。第一篇论文介绍了xNCE,一种对比学习的改进方法,它使用跨模态和模态内负样本来减小图像和文本嵌入中的模态鸿沟。第二篇论文提出了ShapKO,一种动态训练策略,该策略根据验证效用自适应地学习特定模态的剔除概率,以增强多模态医学模型的鲁棒性。

  11. TOOL · CL_129456 ·

    新的FRFDet模型通过新颖的融合技术增强了无人机小目标检测能力

    研究人员开发了FRFDet,这是一种专为无人机(UAV)图像中的小目标检测设计的新型轻量级单阶段检测器。该模型通过引入两个新颖的模块来解决复杂天气和低照度等挑战:用于特征对齐的逆双向采样(IBS)和用于优化语义-空间特征融合的尺度-特征关系交叉融合(SFRCF)。在VisDrone和MS COCO等基准数据集上的实验表明,FRFDet在轻量级检测器中提供了最先进的性能,具有低计算成本和快速推理速度,使其适用于资源受限的无人机平台。

  12. RESEARCH · CL_128853 ·

    新指标EmCom-Diffusion衡量涌现语言中的视觉反射

    研究人员推出EmCom-Diffusion,一个旨在直接衡量涌现语言中“视觉反射”的新框架。该指标评估涌现消息在多大程度上保留了其源图像的信息,从而能够从消息本身重建原始图像。与以往的间接方法不同,EmCom-Diffusion微调了一个文本到图像的扩散模型,以根据涌现消息生成图像,然后将此重建图像与原始图像进行比较,从而更准确地评估视觉内容保留情况。

  13. RESEARCH · CL_121434 ·

    新型优化器ZENITH为计算机视觉模型自动化学习率调度

    研究人员推出了一种名为ZENITH的新型优化器,旨在为深度计算机视觉模型自动化学习率调度。与现有的自适应优化器不同,ZENITH的计算和内存开销为零,并且与正则化技术兼容。在各种图像分类、目标检测和分割任务上的实验表明,与基线方法相比,ZENITH能在更短的时间内获得更高的准确率。另一篇论文重新审视了分析随机梯度算法的经典假设,重点关注方差假设及其在确定性和随机优化问题中的相关性。

  14. RESEARCH · CL_76931 ·

    新的CL-CLIP框架利用CLIP增强持续目标检测能力

    研究人员开发了CL-CLIP,一个用于持续目标检测的新框架,该框架利用CLIP的视觉语言能力。该方法旨在使目标检测器能够随着时间的推移学习新类别,而不会忘记先前获得的知识。CL-CLIP采用成本量化引导的类别解耦方法来处理视觉令牌和类别文本嵌入,从而提高了在PASCAL VOC和MS-COCO等数据集上的性能。

  15. TOOL · CL_70539 ·

    新框架利用图推理纠正跨模态数据中的噪声

    研究人员开发了一个名为 Intra-modal Neighbor-aware Noise Rectification (IN2R) 的新框架,通过解决大规模网络抓取数据中的噪声问题来提高跨模态检索的准确性。与以往过滤或替换噪声标签的方法不同,IN2R 利用模态内数据的几何稳定性来合成可靠的监督目标。该框架使用图精炼器 (Graph Refiner) 和跨模型记忆 (Cross-Model Memory) 来推理邻居并创建一个反映局部语…

  16. RESEARCH · CL_68586 ·

    新方法量化视觉模型中的光谱变化

    研究人员开发了一种新方法,用于量化视觉-语言模型如何通过其投影层改变视觉信息。通过测量傅里叶能量的线性可恢复性,他们发现光谱可及性在模型深度上呈非单调变化。研究表明,CLIP 的投影在光谱上是中性的,而 DINOv2 的池化机制在整个光谱上造成结构化损失,并将中间层和池化识别为光谱转换的关键驱动因素。

  17. TOOL · CL_65512 ·

    新的MoEIoU损失提高了物体检测精度

    研究人员开发了MoEIoU,一种利用专家混合方法的新型物体检测边界框回归损失函数。该方法自适应地结合了重叠度、中心对齐和宽高比不匹配,并采用基于课程的学习加权计划,在不同的训练阶段优先考虑不同类型的误差。MoEIoU在多个数据集和YOLO架构上展示了改进的收敛性和定位精度,优于现有的最先进损失函数。

  18. TOOL · CL_53977 ·

    新的 DANCE 方法改进了弱监督目标检测

    研究人员推出了一种名为 DANCE 的新方法,用于弱监督目标检测 (WSOD),旨在提高准确性,而无需精确的边界框标注。DANCE 通过使用热图引导的建议选择器生成更准确的伪真实边界框来解决现有方法的局限性,这些边界框能够捕捉整个对象并区分相邻实例。它还结合了背景类别表示和负确定性监督,以加速收敛并弥合语义鸿沟。

  19. TOOL · CL_51009 ·

    TinyFormer 混合检测器提高了小目标检测精度

    研究人员推出 TinyFormer,这是一种新颖的混合目标检测模型,旨在提高小目标的识别能力。该模型结合了 YOLO 和 DETR 架构的元素,并融入了 Vision Transformer 表示和特征金字塔颈部。TinyFormer 利用并行双融合模块 (Parallel Bi-fusion Module) 来保持高分辨率细节,并利用空间语义适配器 (Spatial Semantic Adapter) 来补偿 Transformer…

  20. RESEARCH · CL_48270 ·

    MDS-DETR 通过掩码重复抑制提高目标检测性能

    研究人员开发了 MDS-DETR,这是一种新颖的目标检测模型,它改进了 DEtection TRansformer (DETR) 架构。MDS-DETR 通过在单个解码器中集成一对一和一对多标签分配,解决了 DETR 收敛慢和召回率低的问题。这是通过掩码重复抑制器 (MDS) 实现的,该抑制器过滤冗余预测,从而实现更高效、更准确的目标检测。