新的研究强调了在大型语言模型 (LLM) 中保持上下文完整性方面存在的重大挑战。一个名为 CIMemories 的基准测试显示,即使是 GPT-5 等先进模型,也可能出现高达 69% 的属性级别违规,在不同任务和重复运行中不当地泄露敏感用户信息。另一项研究探讨了使用推理和强化学习来灌输上下文完整性,结果显示在保持任务性能的同时,不当披露得到了显著减少。这些发现表明,当前的 LLM 缺乏稳健信息控制所需的细致、依赖上下文的推理能力,这表明存在超出简单提示或扩展的基本限制。 AI
影响 强调了 LLM 在信息控制方面的基本推理局限性,表明当前模型在没有重大进展的情况下可能不适用于敏感应用。
排序理由 该集群包含两篇研究论文,详细介绍了用于评估和改进 LLM 上下文完整性的新基准和方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- CIMemories
- Contextual integrity
- GPT-5
- large-language models
- Mastodon
- PrivacyLens+
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →