研究人员开发了MaliciousSkillBench,这是一个旨在检测恶意代理技能的新基准。恶意代理技能是指可以为LLM代理提供脚本和资源的扩展。该基准整合了来自13个公共来源的数据,形成了一个包含9,740个技能的数据集,其中7,505个被识别为恶意,2,235个被识别为良性。对包括学习型文本检测器和现成扫描仪在内的各种检测方法的评估显示,虽然一些模型在恶意技能方面取得了较高的召回率,但它们在良性技能方面常常面临较高的误报率,这表明需要更强大的检测策略。 AI
影响 该基准有可能提高对嵌入AI代理扩展中的恶意代码的可靠检测,从而增强整体AI安全性。
排序理由 该项目是一篇研究论文,介绍了一个用于检测恶意AI代理技能的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →