differential privacy
PulseAugur coverage of differential privacy — every cluster mentioning differential privacy across labs, papers, and developer communities, ranked by signal.
- instance of alphaXiv 90%
- instance of CatalyzeX 90%
- used by CatalyzeX 70%
- used by ScienceCast 70%
- used by alphaXiv 70%
- used by Gotit.pub 70%
- instance of DP SGD 70%
- instance of Gotit.pub 70%
- used by DP SGD 70%
- uses fully homomorphic encryption 70%
- instance of ScienceCast 60%
- affiliated with fully homomorphic encryption 50%
12 天有情绪数据
-
新的Cocoon架构提高了差分隐私机器学习训练的效率
研究人员开发了Cocoon,一种旨在提高差分隐私机器学习训练效率的新系统架构。该方法通过利用相互抵消的相关噪声,解决了差分隐私通常伴随的准确性下降问题。Cocoon优化了跨CPU、GPU和专用近存储器处理(NMP)设备的大噪声历史记录处理,并包含针对稀疏嵌入表的特定优化。在基于FPGA的NMP原型上进行的测试表明,性能提升了1.23倍至10.82倍。
-
新的以模型为中心的攻击论文质疑合成数据隐私声明
arXiv上的一篇新研究论文,作者为Georgi Ganev,批判性地审视了合成数据生成相关的隐私声明。该论文认为,当前的方法,包括差分隐私(DP)和基于相似性的隐私指标(SBPMs),在提供充分匿名化方面常常不足,尤其是在生成模型可访问的情况下。它提出了一个以模型为中心的隐私攻击视角,认为隐私评估应侧重于底层模型,而不仅仅是数据集,以便更好地符合《通用数据保护条例》(GDPR)等法规。研究结论是,虽然DP提供了强大的保护,但SBPM…
-
新研究推进机器学习和文本生成中的差分隐私
两篇新研究论文探讨了在机器学习和文本生成中实现差分隐私的高级方法。第一篇论文介绍了抽象梯度采样(AGS)算法,该算法扩展了形式化方法,为回归任务中的私有预测和私有学习提供更严格的隐私保证,性能优于全局敏感度基线。第二篇论文提出了PrivCert框架,旨在通过为陈述支持提供隐私保护的认证来解决差分私有文本生成中的证据差距,确保私有报告准确反映底层数据,并与标准DP基线相比减少了不支持的排放。
-
新的Aegis技术增强了医学人工智能联邦学习的隐私性
研究人员开发了一种名为Aegis的新型隐私保护技术,用于医学人工智能中的联邦学习。该方法旨在通过在训练过程中掩盖梯度来保护敏感的患者数据,防止模型反演攻击。Aegis通过将合成梯度叠加到真实更新之上来实现这一点,有效地增加了超出已知攻击能力范围的批次大小,同时不损害诊断准确性或改变联邦学习协议。在MNIST、CIFAR-10和MedMNIST等数据集上的评估表明,Aegis在保持模型效用的同时,能有效中和最先进的攻击。
-
新的 DLaaS 框架简化了开发者的分布式学习
一篇新论文介绍 DLaaS(分布式学习即服务),一个旨在简化应用程序开发者的分布式和联邦学习的框架。DLaaS 允许开发者通过单一管理仪表板激活差分隐私、模型拆分学习、分层聚合和知识蒸馏等功能,而无需更改客户端代码。该系统在智能家居唤醒词任务上进行了演示,使用了 "Ok Aura" 数据集,训练在 Android 客户端和辅助聚合器上进行,最终模型部署在 Android 应用程序中进行实时推理。
-
Google 通过 TEE 增强联邦学习隐私;新 arXiv 论文探讨模型合并与效率
Google Research 开发了一个新的联邦学习系统,通过可信执行环境 (TEE) 增强隐私,允许可验证的数据匿名化和更快的训练。该系统已在 Gboard 中实现,建立在先前差分隐私和安全聚合工作的基础上。同时,几篇 arXiv 论文探讨了联邦学习的进展,包括带有预训练权重的模型合并技术、处理非 IID 数据和动态客户端参与的框架、渐进式分辨率安全聚合、用于效率的潜在信息共享以及用于安全和通信优化的压缩方法。
-
缺失数据可增强隐私,arXiv新论文提出
一篇新研究论文发布在arXiv上,探讨了通过缺失数据实现隐私放大的概念。该研究由Simon Roburin领导,提出了一个将缺失数据整合到差分隐私中的框架,表明固有的数据缺失可以增强隐私保证,而无需改变底层机制。这种方法与医学和金融等高风险领域特别相关,这些领域中的敏感信息需要强大的保密性。
-
新的QuanText方法保护文本数据集中的敏感数据
研究人员开发了QuanText,一种用于保护文本数据集中敏感信息的新颖方法。这种无需训练的方法旨在与任何大型语言模型兼容,并专注于保护全局数据集属性,例如与特定人群或主题相关的记录比例。QuanText通过扰乱秘密分布和相关属性来工作,确保在模糊敏感的聚合信息的同时,保持数据在下游应用程序中的效用。
-
新框架分析隐私对医学影像AI的影响
研究人员引入了一个名为“用于医学影像的差分隐私表示几何”(DP-RGMI)的新框架,以更好地理解差分隐私如何影响医学影像分析。该框架将隐私度量解释为表示空间的变换,并将性能损失分解为与编码器几何和任务头利用相关的部分。使用四个胸部X光数据集的超过594,000张图像进行的实验表明,即使在保持线性可分性的情况下,差分隐私也会持续产生利用率差距。研究还发现,DP改变表示的各向异性,而不是均匀地压缩特征,位移和频谱维度显示出依赖于初始化和数…
-
新方法CANAL增强了医学图像分割的隐私保护
研究人员开发了CANAL,一种用于医学图像分割的差分隐私特征蒸馏的新方法。该技术通过导出特征表示而不是原始图像来解决共享医学数据时的隐私问题。CANAL通过每次每张图像仅采样一次的方法降低隐私成本,并根据通道重要性更有效地分配噪声,从而保留更多与任务相关的信号,从而改进了现有方法。
-
SpliTEE 使用差分隐私实现受信任硬件上的安全 LLM 推理
研究人员开发了 SpliTEE,这是一种旨在增强受信任硬件上大型语言模型 (LLM) 推理隐私的新型架构。该系统将 LLM 计算分配给一个基于 CPU 的安全可信执行环境 (TEE) 和一个更快的、不受信任的 GPU。与以前的基于加密的方法不同,SpliTEE 采用差分隐私来掩盖发送到 GPU 的中间输入,从而防止提示重建攻击。该方法将 LLM 保留在浮点域中,避免了量化,并与全基于 CPU 或基于加密的分离方法相比,实现了更快的推理…
-
新AI方法通过抑制风格特征来匿名化文本
研究人员开发了一种新颖的风格感知释义方法来匿名化文本,解决了作者身份归属模型带来的隐私风险。该方法利用大型语言模型创建风格档案并重写文本,有效降低了重新识别用户的能力,同时保留了内容的含义和可读性。该方法在匿名化效果方面显著优于现有的差分隐私技术和其他基线。
-
新的“$\alpha$-split”方法增强了联邦学习中语音大模型的隐私保护
研究人员开发了一种名为“$\alpha$-split”的新方法,以提高多语言语音大语言模型(speech-LLMs)在联邦学习中的差分隐私保护。标准的逐层差分隐私方法在声学编码器和语言解码器组件更新范数差异显著时会遇到困难,导致“跨组件预算崩溃”。提出的$\alpha$-split方法通过为编码器和LLM参数创建两个独立的池来解决这个问题,在保持原始$(\varepsilon,\delta)$-DP保证的同时,为编码器提供了增强的噪声…
-
差分隐私在合成文本发布中未能保护弱势子群
对差分隐私合成文本发布的新审计显示,虽然差分隐私(DP)能有效减少平均成员推断泄露,但它对某些记录的保护程度不成比例。该研究定义了一个子群目标成员推断博弈来量化这种风险,表明合成发布仍然可能泄露子群成员身份。研究还强调,泄露信息的具体记录取决于所使用的发布机制,而不仅仅是记录本身。
-
新框架使用 JLT 进行差分隐私变量选择
研究人员开发了一个用于高维变量选择的新框架,该框架可维护差分隐私。该方法使用 Johnson-Lindenstrauss Transform (JLT) 来私有化数据矩阵,在遵守 $(\epsilon,\delta)$-差分隐私约束的同时保留协变量关系。该方法在理论上保证了对错误发现率 (FDR) 的控制,并分析了隐私和统计功效之间的权衡,表明在严格的隐私预算下,JLT 在保持功效方面优于传统的噪声注入方法。
-
新的扩散模型PrivateHub增强了传感器密集环境的数据隐私性
研究人员开发了PrivateHub,这是一种新颖的对比扩散模型,旨在生成合成的多传感器数据,同时保护用户隐私。该模型分两个阶段运行:应用条件预训练(ACP)和应用感知微调(AAF),利用对比学习来区分私有和非私有应用。实验表明,PrivateHub在不影响非私有应用检测的情况下,可以将推断私有应用的准确性降低40-50%,并能抵御攻击者在合成数据上重新训练的攻击。
-
新的 XCal-FL 算法增强了差分隐私联邦学习的可解释性
研究人员开发了 XCal-FL,一种新颖的联邦学习算法,该算法动态校准差分隐私噪声以提高可解释性。该方法解决了标准差分隐私可能扭曲模型表示并降低解释保真度的问题,这对于临床诊断等应用至关重要。XCal-FL 在训练过程中使用三个信号——logit 变化、反事实边际和显着性集中度——来调整噪声,从而得到更准确、更易于理解的模型。实验表明,XCal-FL 在预测性能和解释保真度方面均显著优于现有方法,并且在隐私预算方面也更有效率。
-
新系统保护农民数据用于农业人工智能
研究人员开发了一个名为私有计算空间(PCS)的新系统,以解决阻碍人工智能在农业领域应用的隐私问题。这个开源机器学习系统使用联邦学习、差分隐私和可信执行环境来安全地处理农民数据,同时保持模型的效用。PCS 在纽约和加利福尼亚部署,在监测植物氮含量和预测蒸散量方面证明了其有效性,在不损害隐私的情况下将模型准确性提高了高达 22.4%。
-
研究发现:Split-LLM 训练通过梯度模式泄露私有数据
一项关于 split-LLM 训练的新研究揭示了一个关键的隐私漏洞,其中返回的梯度会无意中暴露敏感数据。研究人员发现,尽管初步的隐私检查通过了,但与诱饵数据点相关的零梯度模式允许攻击者识别真实数据行。即使进行了梯度裁剪和噪声注入,这种泄露仍然存在,并可能导致令牌恢复攻击。这些发现突显了在分布式 LLM 训练中平衡效用和隐私的挑战,尤其是在反向通信方面。
-
新框架提升机器学习中DP-SGD的经验隐私性
研究人员引入了一个新框架,以增强机器学习算法的经验隐私性,特别是针对DP-SGD。该框架旨在优化经验隐私下界,作为现有理论上界的补充。所提出的防御措施旨在提高标准基准测试上的经验隐私性,在使用DP-SGD时没有理论隐私成本,并为各种审计构造、模型和数据集提供灵活的解决方案。