Ms Coco
PulseAugur coverage of Ms Coco — every cluster mentioning Ms Coco across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新攻击通过操纵潜在频率侵蚀AI图像水印
研究人员开发了一种名为潜在频率掩码(Latent Frequency Masking)的新攻击方法,可以有效去除或削弱嵌入AI生成图像中的不可见水印。该技术操纵图像潜在表示中的傅里叶系数,提供基于噪声的替换或扩散再生选项以保持图像质量。评估表明,Latent Frequency Masking在水印擦除和感知质量方面优于现有攻击,凸显了当前生成图像水印安全性的重大漏洞。
-
新方法高效归因扩散模型训练数据
研究人员开发了一种名为TID(Training-data Influence via score Discrepancy)的新方法,用于高效地归因扩散模型的训练数据。该方法无需昂贵的每样本梯度计算或重新训练即可估算影响。一个蒸馏版本TIDE通过训练一个仅前向传播的学生模型来复现教师的排名,进一步降低了计算成本,从而能在毫秒内完成归因。
-
新的ViD框架解决了视觉语言模型中的性别偏见问题
研究人员推出了一种新颖的框架ViD,旨在缓解大型视觉语言模型(LVLMs)中的性别偏见。与需要训练阶段调整或事后校准的先前方法不同,ViD通过分析注意力机制来动态解决视觉偏见,而无需额外的训练开销。该框架采用后门调整和精炼的token选择,以抑制源于强大语言先验的偏见,同时保持通用的推理和文本生成质量。ViD在FACET和MS COCO等基准测试中显著减少了性别偏见,尤其提升了LLaVA模型的性能。
-
FLAT框架统一多模态生成和表示学习
研究人员推出了一种新颖的多模态表示学习和生成框架FLAT,该框架将这两个阶段统一为单个过程。FLAT将图像和文本重采样为灵活长度的对齐一维令牌序列,使其能够被生成解码器直接使用,并产生线性可插值的嵌入。这种方法在文本到图像生成、MS-COCO上的图像字幕生成以及MS-COCO和Flickr30K上的跨模态检索等任务上取得了强劲的性能。
-
新的JPPO攻击通过优化像素和提示来利用视觉语言模型
研究人员开发了一种名为联合像素-提示优化(JPPO)的新型对抗性框架,该框架以视觉语言模型(VLMs)为目标。与以往专注于图像扰动的方法不同,JPPO联合优化图像像素和用户可见的提示,以放大资源耗尽攻击。这种方法显著增加了Qwen2.5-VL-7B和BLIP-2等模型的延迟和能耗,揭示了当前VLM服务防御中潜在的安全漏洞。
-
新框架KBK增强多标签类别增量学习
研究人员开发了一个名为KBK(Knowing Beyond the Known)的新框架,以改进多标签类别增量学习(MLCIL)。该方法解决了区分已知和未知信息所带来的挑战,而这些信息会阻碍在具有共现和不完整标签的场景中的性能。KBK采用分层特征净化模块来分离特定类别的特征,并采用不确定性感知召回策略来增强历史数据保留。它还利用语义相关性来生成用于未来学习的信息性未知特征,以及类别平衡梯度补偿损失来管理遗忘。
-
新框架在无显式背景监督下学习物体性
研究人员开发了一个名为背景无关物体性学习(B-FOR)的新框架,用于类别无关物体检测。该方法在没有显式背景监督的情况下学习物体性,解决了传统闭集训练可能导致的物体性偏差的局限性。B-FOR 预测密集的物体中心和尺度场,并使用结构化软目标将监督限制在标注区域内。在 PASCAL VOC、MS-COCO 和 Open Images 数据集上的实验表明,该方法在泛化到未见类别和跨数据集分布方面有所改进,比之前的类别无关基线高出 10 个 AR 点以上。
-
新方法增强了专业化目标检测器之间的知识迁移
研究人员引入了社交化检测器学习(Socialized Detector Learning, SDL)和轨迹引导式互惠蒸馏(Trajectory-Guided and Reciprocal Distillation, TGRD),以改进异构目标检测器之间的知识迁移。TGRD 能够估计检测器之间迁移知识的难度,并构建最优迁移路径。该方法允许检测器相互学习,在保持原有专业化的高性能的同时,扩展它们的类别支持。
-
新的DistScan框架可检测目标检测模型的后门
研究人员开发了DistScan,一个用于检测目标检测模型后门的新型框架。该方法通过分析模型在干净数据上预NMS预测类别分布的偏移来识别恶意修改,这与正常训练频率不同。DistScan无需访问模型权重或了解触发器,并且在现有技术之上表现出色,尤其是在场景级攻击方面。
-
新方法提升体操极端姿势的AI姿态估计
研究人员开发了一种方法来改进蹦床体操中的人体姿态估计,这项运动的特点是姿势极端且视角不寻常。通过结合真实的极端姿势和从动作捕捉录音生成的合成数据来微调ViTPose模型,他们实现了显著的准确性提升。这种方法弥合了挑战性姿势的性能差距,将平均每关节位置误差(MPJPE)降低了42.7%(3D)。
-
基于概念的可解释人工智能揭示深度神经网络的弱点和数据集偏差
研究人员探索了使用基于概念的可解释人工智能(CXAI)方法来理解多标签图像分类中深度神经网络(DNN)的学习弱点和偏差。通过在 MS-COCO 数据集上训练 VGG16 和 ResNet50 模型,并应用 CRP 和 CRAFT 等 CXAI 技术,研究发现更高的概念区分度可以减少标签和概念中的混淆。分析还强调了数据集中环境概念如何暴露模型固有的偏差。
-
新的PROVE方法使用可验证证据恢复AI图像提示
研究人员开发了PROVE,一种新颖的无训练方法,用于从文本到图像模型生成的图像中恢复文本提示。与依赖优化、字幕或强化学习的现有技术不同,PROVE通过直接从图像证据组合可验证的场景描述来重建提示。这种方法旨在通过提供基于显式视觉数据的可审计提示来解决版权和内容所有权问题。PROVE在多个数据集和生成器上,与当前基线相比,在图像相似性和文本-图像对齐方面表现出优越的性能,而无需任何训练或生成器访问。
-
新的PEAK框架可精确擦除文本到图像模型中的概念
研究人员开发了PEAK,一个用于精确持久地擦除文本到图像扩散模型中概念的新框架。该方法利用k稀疏自编码器(kSAEs)将密集表示分解为可解释的稀疏特征。通过识别并选择性地抑制目标特定特征,同时保留其他特征,PEAK旨在防止意外的语义干扰和被擦除概念的对抗性恢复。实验表明,PEAK显著减少了敏感内容的检测,并保持了生成质量。
-
新型 Poly-DETR 模型连接物体检测与分割
研究人员推出了一种新颖的方法——多边形检测 Transformer (Poly-DETR),它弥合了物体检测与分割之间的差距。该方法利用极坐标表示直接构建逼近轮廓的多边形,与传统的边界框或像素级掩码相比,提供了更紧凑、更准确的表示。Poly-DETR 与 DETR 类检测器无缝集成,并引入了极坐标可变形注意力 (Polar Deformable Attention) 和感知位置的训练方案 (Position-Aware Trainin…
-
DSeq-JEPA架构通过顺序预测增强视觉表示学习
研究人员推出了一种新颖的自监督视觉表示学习架构DSeq-JEPA。该模型在基于图像的联合嵌入预测架构(I-JEPA)的基础上,通过引入判别式顺序预测过程。DSeq-JEPA首先关注重要的视觉区域,然后逐步预测后续区域,模仿人类的注意力。在图像分类和目标检测等多个基准测试中的实验表明,DSeq-JEPA比其前身学习到更鲁棒、更具泛化性的表示。
-
DeCLIP框架增强CLIP以实现多标签增量学习
研究人员推出DeCLIP,一个新颖的框架,旨在通过解决CLIP模型的问题来改进多标签类别增量学习(MLCIL)。DeCLIP利用解耦提示来学习特定类别的正向和负向提示,这有助于匹配视觉-语言对并减少视觉表示的纠缠。这种方法旨在减轻灾难性遗忘,而无需数据重放。此外,DeCLIP还包含一种称为自适应相似度调节(Adaptive Similarity Tempering)的推理时策略,以减少部分标记场景中的误报。
-
新的基准和框架推动网络监督多标签图像识别
研究人员推出了一种新的网络监督多标签识别基准,该领域使用免费的网络图像来训练深度学习模型,从而减少了对昂贵手动标注的需求。该基准名为 Web-COCO 和 Web-Pascal,包含约 300,000 张图像,旨在标准化多标签识别任务的评估协议。除了基准之外,研究团队还提出了一个双分支多标签对比学习 (DBMLCL) 框架,该框架在识别和纠正噪声标签方面表现出卓越的性能。
-
新研究解决多模态学习中的模态鸿沟和鲁棒性问题
两篇新研究论文探讨了通过解决模态鸿沟和鲁棒性挑战来改进多模态学习的方法。第一篇论文介绍了xNCE,一种对比学习的改进方法,它使用跨模态和模态内负样本来减小图像和文本嵌入中的模态鸿沟。第二篇论文提出了ShapKO,一种动态训练策略,该策略根据验证效用自适应地学习特定模态的剔除概率,以增强多模态医学模型的鲁棒性。
-
新的FRFDet模型通过新颖的融合技术增强了无人机小目标检测能力
研究人员开发了FRFDet,这是一种专为无人机(UAV)图像中的小目标检测设计的新型轻量级单阶段检测器。该模型通过引入两个新颖的模块来解决复杂天气和低照度等挑战:用于特征对齐的逆双向采样(IBS)和用于优化语义-空间特征融合的尺度-特征关系交叉融合(SFRCF)。在VisDrone和MS COCO等基准数据集上的实验表明,FRFDet在轻量级检测器中提供了最先进的性能,具有低计算成本和快速推理速度,使其适用于资源受限的无人机平台。
-
新指标EmCom-Diffusion衡量涌现语言中的视觉反射
研究人员推出EmCom-Diffusion,一个旨在直接衡量涌现语言中“视觉反射”的新框架。该指标评估涌现消息在多大程度上保留了其源图像的信息,从而能够从消息本身重建原始图像。与以往的间接方法不同,EmCom-Diffusion微调了一个文本到图像的扩散模型,以根据涌现消息生成图像,然后将此重建图像与原始图像进行比较,从而更准确地评估视觉内容保留情况。