一篇新论文揭示,来自 OpenAI、Anthropic 和 Google 等主要 AI 提供商的加密推理痕迹并非安全边界。研究人员演示了这些痕迹可以在不同模型和会话之间重放,从而允许较弱的模型以明文形式揭示更强大模型的隐藏推理。这种漏洞对数据提取、代理系统的安全性以及模型切换的用户体验都有影响。 AI
影响 这种漏洞可能会影响 AI 代理的安全性,并需要改变模型提供商处理推理痕迹的方式,可能影响用户体验。
排序理由 该集群讨论了一篇研究论文,该论文演示了 AI 模型推理痕迹中的一个安全漏洞。
- Anthropic
- arXiv:2608.09867
- GPT-5.5
- Hacker News
- Haiku
- mini
- OpenAI
- Opus
- Stealing Reasoning Traces from Proprietary LLM APIs
- Claude
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →