研究人员发现了一种名为函数劫持攻击(FHA)的新型安全威胁,该威胁针对利用函数调用功能的代理AI模型。这些攻击会操纵模型的工具选择过程,强制调用攻击者选择的函数,绕过语义理解,并在不同领域和函数集中保持有效。FHA在包括指令模型和推理模型在内的各种LLM上都显示出很高的成功率,并且在不同模型大小和系列之间具有可转移性,这凸显了代理AI系统对强大安全措施的迫切需求。 AI
影响 凸显了代理AI中关键的安全漏洞,为已部署的系统带来了新的防护措施和安全协议。
排序理由 详细介绍新型AI模型安全攻击的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- agentic AI
- function calling
- Function Hijacking Attacks
- Hugging Face
- large-language models
- Yannis Belkhiter
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →