一篇新论文揭示了Anthropic、OpenAI和Google的专有LLM API中存在一个漏洞,允许提取和重放加密的推理痕迹。研究人员证明,这些加密的“思维块”在同一提供商生态系统内的模型和会话之间是可互换的。通过将加密痕迹注入较弱的模型,攻击者可以迫使其暴露较强模型的隐藏推理,从而绕过反蒸馏措施。此技术还可以暴露无意中包含在这些隐藏痕迹中的敏感数据,如API密钥和个人信息,并可能实现隐形提示注入。 AI
影响 暴露敏感数据和知识产权,可能影响LLM API的企业采用和安全实践。
排序理由 论文详细介绍了LLM API推理痕迹加密中的一个漏洞。
在 Hugging Face Daily Papers 阅读 →
- Alexander V Panfilov
- Anthropic
- OpenAI
- Claude Haiku 4.5
- GPT-5.5
- GPT 5.6 Luna
- proprietary LLM APIs
- Simon Willison
- arXiv
- Claude (Opus 4.8)
- Hacker News
- Matthew D. Green
AI 生成摘要 · Google Gemini · 来自 8 个来源。 我们如何撰写摘要 →