实体
SkillHarm
SkillHarm
PulseAugur coverage of SkillHarm — every cluster mentioning SkillHarm across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新基准揭示AI代理技能易受新型攻击
研究人员开发了SkillHarm,一个用于评估AI代理技能安全漏洞的新基准。该基准包括两种攻击场景:固定载荷投毒(Fixed-Payload Poisoning),其中技能直接破坏任务;以及自变异投毒(Self-Mutating Poisoning),其中技能会随着时间推移而改变自身。SkillHarm包含71个技能的879个攻击样本,表明当前代理的成功率高达86.3%,存在漏洞。研究还强调,许多看似成功的防御措施是由于代理未与被投毒…
-
新基准揭示AI代理易受基于技能的攻击
研究人员开发了SkillHarm,这是一个旨在通过评估其生命周期中的基于技能的攻击来测试AI代理安全性的新基准。该基准包括用于构建受污染技能的自动化方法,展示了当前代理存在的重大漏洞,攻击成功率高达86.3%。研究结果表明,许多明显的防御成功是由于代理未与受污染文件交互,表明当前的防御措施不足。