一个新的基准MaliciousSkillBench已被开发出来,用于检测恶意代理技能,这些技能可以扩展LLM代理并赋予其潜在的有害能力。该基准整合了来自13个公共来源的数据,形成了一个包含9,740个技能(7,505个恶意和2,235个良性)的数据集,以解决现有恶意技能数据集碎片化的问题。对各种检测方法的评估,包括学习到的文本检测器和现成的扫描器,显示虽然一些方法实现了高召回率,但它们常常在假阳性或跨来源评估方面遇到困难,这表明需要更鲁健的检测策略。 AI
影响 强调了LLM代理技能日益增长的安全风险以及检测恶意代码的挑战。
排序理由 该集群关注一个新的学术基准以及对恶意代理技能检测方法的评估。
- Agent Skills
- MaliciousSkillBench
- TF-IDF SVM
- Cisco
- Claude Code
- GitHub
- MalSkillBench
- NVIDIA
- Python
- SENTRY
- SkillSpector
- skillvet
- Yara International
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →