研究人员开发了一套名为LeakyLMs的新攻击方法,通过分析令牌生成的时间戳,可以推断出有关语言模型的专有信息,包括其架构和推理优化。此方法甚至可以通过远程API提取详细信息。一项攻击成功识别出Google Gemini Flash 2.5使用了具有约128K令牌草稿上下文窗口的推测性解码。另一项攻击可以恢复架构属性,如Transformer层数、隐藏层维度大小和注意力头数,在识别Llama模型配置方面准确率超过90%。 AI
影响 揭示了已部署LLM的潜在安全漏洞,影响模型的安全性和架构保护方式。
排序理由 详细介绍语言模型新攻击方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →