Celeba
PulseAugur coverage of Celeba — every cluster mentioning Celeba across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的线性规划方法无需标签即可修剪数据集
研究人员开发了一种新颖的数据集修剪方法,该方法使用线性规划来选择代表性数据子集,而无需标签或模型训练。该方法将无偏子集选择重新表述为方差最小化问题,并从嵌入空间属性推导出几何标准。在 CIFAR-10、MNIST 和 CelebA 基准上的实验表明,该方法在各种数据预算下,在测试准确性方面可媲美甚至超越均匀采样,并且优于现有的几何方法,尤其是在较小的预算下。该框架通过增强小批量多样性,在减少随机梯度方差方面也具有优势。
-
新的EOFlows方法推动了AI中无监督特征发现的进展
研究人员推出了一种新颖的无监督特征发现框架——熵序流(EOFlows),用于表示学习。该方法利用了一个增强了独立机制分析导出的正交性正则化器的归一化流,实现了几何解耦,并使其能够处理CelebA等图像数据集。与现有技术相比,EOFlows能够识别出更多数量的稳定特征,并将它们分为全局、局部和通用类型,并且可以根据其“解释(流形)熵”进行排序,提供了PCA的非线性泛化。
-
新研究通过效率和性能提升推进扩散语言模型 · 已追踪10个来源
研究人员正在开发改进扩散语言模型(DLM)的新方法,重点关注效率和性能。“Clock Diffusion”引入了具有位置相关噪声调度的半自回归连续DLM,在OpenWebText上达到了最先进的界限,并在GSM8K上超越了基线。另一种方法ITC-MoE使用重要性引导的令牌感知压缩来降低混合专家DLM的计算和存储成本,同时保持生成质量。其他进展包括分层连续扩散语言模型(HC-DLM),它将离散令牌生成与连续潜在轨迹相结合;自排斥采样(S…
-
CyclOT框架学习来自非配对数据的二次最优传输图
研究人员推出了一种新颖的神经网络框架CyclOT,用于从高维非配对样本中学习二次最优传输图。这种双向方法利用同步的前向-后向插值以及结合了双向二次作用、判别器约束的Jensen-Shannon端点目标和循环一致性的训练目标。该方法不需要预先计算的样本配对或显式的凸势参数化。理论结果表明,在特定条件下,该方法能够恢复最优传输图,并且在MNIST和CelebA等各种数据集上的实验验证了其性能。
-
新方法LEAPSC增强了深度联合信源信道编码的隐私性
研究人员开发了LEAPSC,一种用于隐私保护的深度联合信源信道编码的新方法。该技术将内循环最小二乘概念擦除集成到变分信息瓶颈编码器中,以防止在数据传输过程中泄露性别或种族等敏感属性。LEAPSC在CelebA和FairFace等数据集上表现出色,在保持攻击者准确率接近偶然水平的同时实现了高任务准确率,优于现有的对抗性基线。
-
新的SAGE框架解决了机器学习模型中的虚假相关性问题
研究人员开发了SAGE,一个新颖的两阶段生成增强框架,旨在解决机器学习模型中的虚假相关性问题。该方法利用聚类衍生的子标签和类别标签来微调生成模型和文本编码器,创建合成数据以平衡训练集中的代表性不足的区域并构建平衡的验证集。SAGE旨在通过减轻对多数虚假属性的依赖来提高模型在少数群体上的性能,其表现优于现有的无分组标签方法。
-
新蒸馏方法将人脸合成速度提升 4 倍以上
研究人员开发了一种方法,利用扩散模型加速合成人脸图像的生成。通过将 Arc2Face 模型中的知识蒸馏到潜在一致性模型中,他们在推理速度上实现了 4.36 倍的加速。蒸馏后的模型保持了具有竞争力的图像质量,在 CelebA 上表现接近,在 WebFace42M 上优于教师模型,使其适用于大规模合成人脸数据集的创建。
-
研究发现,文本引导模型在面部编辑中存在偏见
一项发表在arXiv上的新研究评估了六种用于面部编辑任务的文本引导扩散模型,并将其性能与GANs和3DMMs等成熟方法进行了比较。该研究引入了Face-Edit-Attributes,一个包含169个面部编辑属性的数据集,并分析了大约一百万张图像。研究结果表明,虽然模型在头发和配饰编辑方面表现良好,但在姿势调整方面却表现不佳,并且有过度编辑的倾向,尤其是在涉及深色皮肤男性面孔和老年人的编辑中,观察到了显著的人口统计学偏见。
-
新的DiffSwap++方法增强了身份保持的人脸交换
研究人员开发了DiffSwap++,一种新的人脸交换扩散模型方法,显著提高了身份保持能力并减少了伪影。该方法在训练过程中融入了3D面部潜在特征,从而更好地将身份与姿势和表情分离开来。该系统以身份嵌入和面部地标为条件进行去噪过程,在CelebA、FFHQ和CelebV-Text等基准数据集上取得了高保真度的结果。使用生物识别风格指标和用户研究进行的评估进一步验证了其有效性。
-
混合GAN-扩散模型提升图像修复质量
研究人员开发了一个新颖的混合框架GAN-Diff,它结合了生成对抗网络(GANs)和扩散模型以增强图像修复。该方法利用预训练的带梯度惩罚的Wasserstein GAN(WGAN-GP)特征作为条件扩散U-Net中的先验。通过交叉注意力整合冻结的WGAN-GP生成器特征,该框架通过稳定有效的图像修复过程来指导扩散模型。在去噪和超分辨率任务上的评估显示出显著的改进,去噪的PSNR提高了4.40 dB,超分辨率提高了3.70 dB。
-
新的隐私技术通过噪声锚点增强协作学习
研究人员开发了一种名为“带噪声锚点对齐的几何数据扰动”的隐私保护协作学习新方法。该技术旨在保护个体参与者的数据,同时实现有效的模型训练。与直接对私有数据添加噪声相比,所提出的方法将噪声添加到锚点表示中,这提高了学习准确性并减少了数据泄露,如在 MNIST 和 CelebA 数据集上的实验所示。
-
新方法从人脸识别模型中重建训练数据
研究人员开发了一种名为转向流模型反转(SFMI)的新方法,用于从人脸识别模型中重建训练样本。该技术通过将反演过程重新构建为轨迹转向任务来解决现有方法的局限性。SFMI采用两阶段方法:首先,它学习通用的流匹配先验来编码人脸;其次,它采用渐进式引导调度器在生成过程中注入目标特定梯度。这使得人脸图像的重建更加稳定且视觉上更忠实,在白盒模型反演攻击中取得了有竞争力的性能。
-
新方法揭示视觉模型中的空间捷径模式
研究人员开发了一种新方法,通过将每张图像的贡献图分组为重复的空间模式,来识别和表征视觉模型中的捷径学习。该方法利用 K-means 和非负矩阵分解,揭示了在各种数据集和模型架构(如 ResNet 和 ViT)中,捷径和任务贡献的共享和不同空间模式。发现的捷径组能够针对性地检查错误率较高的图像子集,而抑制捷径贡献的干预措施会显著降低模型性能,这表明结合抑制和放大方法可以减少性能差异。
-
新框架审计AI面部分析中的隐藏公平性风险
研究人员开发了一个名为CIFA(上下文-交叉公平性审计)的新框架,用于识别面部分析系统中隐藏的漏洞。该框架超越了传统的群体公平性指标,还考虑了诸如光照和图像质量等上下文因素,以及这些因素如何与群体属性相互作用。使用ResNet-50和ViT-B/16模型在FairFace和CelebA等数据集上进行的评估显示,被总体准确性和仅基于群体因素的评估所掩盖的性能差异显著。研究还发现,现有的缓解策略并不能持续消除这些隐藏的子群体风险。
-
新框架揭示面部分析AI中隐藏的公平性缺陷
研究人员开发了一个名为CIFA(上下文-交叉公平性审计)的新框架,用于识别计算机视觉模型(尤其是在面部分析领域)中隐藏的漏洞。该框架超越了传统的公平性评估,不仅审计人口统计学属性,还审计光照和图像质量等上下文因素,以及它们与人口统计学属性的交叉。在跨多个数据集的面部性别分类模型(ResNet-50和ViT-B/16)上进行测试时,CIFA揭示了特定子群体中显著的性能差异,这些差异被聚合指标和仅人口统计学分析所忽略。研究还发现,现有的缓…
-
DeepForgeSeal 使用潜在空间水印进行鲁棒的深度伪造检测
研究人员开发了 DeepForgeSeal,一个旨在应对日益严峻的深度伪造挑战的新型深度学习框架。该系统利用嵌入在图像潜在空间中的半脆弱水印,能够鲁棒地检测恶意篡改,同时保持对良性失真的完整性。该框架采用对抗性强化学习 (ARL) 来优化鲁棒性和脆弱性之间的平衡,在 CelebA 和 CelebA-HQ 基准测试中表现优于现有方法。
-
新研究解决了扩散模型水印和攻击方法问题
两篇新研究论文介绍了用于扩散模型水印和攻击现有水印的新颖方法。第一篇论文FARI提出了一个快速的单步逆转框架,提高了鲁棒性并显著减少了水印验证的处理时间。第二篇论文FDDWAN提出了一个频率解耦的扩散网络,旨在有效去除图像中的不可见水印,同时保持感知保真度。
-
新研究探讨流匹配模型增强与漏洞 · 跟踪9个来源
研究人员正在探索增强流匹配模型的新方法,流匹配是生成任务的一种流行范式。一篇论文引入了“去噪加速”(accel)作为估计流匹配动作不确定性的免费代理,通过识别错误输出来提高实时控制的安全性,而无需额外的计算开销。另一项研究提出了“DRIFT”,一种对抗性补丁攻击,通过靶向去噪轨迹来有效破坏流匹配的视觉-语言-动作模型,揭示了其感知鲁棒性中令人惊讶的漏洞。此外,还提出了“单侧分位数耦合流匹配”(QC-FM)和“能量引导流匹配”(EG-F…
-
新的扩散模型提供基于概念的可视化反事实解释
研究人员开发了C-VCE,一个新颖的扩散模型框架,旨在为AI预测提供基于概念的可视化反事实解释。与依赖外部、可能脆弱的分类器的先前方法不同,C-VCE将概念瓶颈层直接集成到生成模型中。这使得解释可以由人类可解释的特征来指导,使用户能够切换概念并最小化调整相关图像区域,同时保持整体图像的完整性和特征相关性。该框架包括一个概率正则化器和一个基于梯度的掩码,以确保编辑是小的、受控的,并且仅限于最相关的图像区域,使其成为安全关键应用的更实用工具。
-
新的正则化方法解决自监督学习中的偏见问题
研究人员推出了一种名为无偏开放世界正则化(UOWReg)的新型框架,旨在减轻自监督学习(SSL)和联合嵌入预测架构(JEPAs)中的偏见。与使用全局正则化的先前方法不同,UOWReg 侧重于条件分布匹配,确保学习到的表示与目标属性之间的统计独立性。该方法在 CelebA 等基准测试中有效减少了偏见违规行为,同时保持了具有竞争力的准确性。此外,UOWReg 在防止复杂场景(如新提出的合成雕刻任务)中的亚群崩溃方面显示出潜力,通过有效分离细微特征。