研究人员在 Anthropic、OpenAI 和 Google 的 API 生态系统中发现了一个漏洞,该漏洞允许提取所谓的隐藏推理轨迹。通过将加密的推理块重放到较弱的兼容模型中,这些模型充当解密预言机,将不透明的轨迹解密为可读的明文。对公开的代理轨迹的扫描发现了这些解码块中的个人信息和凭据,凸显了嵌入 AI 推理输出中的敏感数据的潜在安全风险。 AI
影响 凸显了 AI 推理数据处理方式中潜在的安全缺陷,敦促对敏感信息保持谨慎。
排序理由 学术论文,详细介绍了针对 AI 推理输出的新型攻击向量。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →