研究人员引入了一个名为 P3Bench 的新基准,以解决大语言模型 (LLM) 中的个性化隐私控制问题。该基准扩展了上下文隐私策略,纳入了用户特定的披露偏好,认识到即使在同一上下文中,个体之间可接受的信息披露程度也可能存在显著差异。实验表明,基于提示的策略在强制执行这些个性化隐私设置方面并不可靠,Qwen2.5-7B 和 Gemma3-4B 等模型表现出很高的策略忽略率。为了克服这一问题,开发了一种名为 Repair 的新颖推理时方法,该方法使用注意力头干预来引导大语言模型的披露行为符合用户定义的隐私策略。 AI
影响 这项研究可能带来更强大的大语言模型隐私控制,从而能够更安全地部署处理敏感用户数据的代理式人工智能系统。
排序理由 该集群包含一篇学术论文,详细介绍了大语言模型隐私的新基准和方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →