研究人员开发了一种新颖的方法,在满足提示级别差分隐私的同时,使用可验证奖励(RLVR)的强化学习来训练语言模型。该方法确保发布的模型权重对于单个训练问题是差分私有的。该方法聚合梯度、裁剪贡献、添加高斯噪声并组合隐私损失,提供了已知的首个 RLVR 训练的差分隐私保证。使用 Qwen2.5-1.5B-Instruct 进行的实验表明,即使在隐私限制下,奖励信号也能显著提高 MATH 和 GSM8K 等数学任务的准确性,其性能优于有监督微调方法,并保留了非私有方法的大部分收益。 AI
影响 这项研究有可能在不显著降低性能的情况下,实现更私有的 AI 模型开发,特别适用于敏感数据应用。
排序理由 该集群包含一篇学术论文,详细介绍了一种具有差分隐私保证的语言模型训练新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →