研究人员推出了SCRIPTIOC-BENCH,这是一个旨在评估大型语言模型(LLM)从基于脚本的恶意软件中提取可操作威胁情报能力的新基准测试。该基准测试包含634个手动验证的JavaScript、PowerShell和VBScript样本,对妥协指标(IOCs)进行分类,如URL、域名、IP地址和文件系统伪影。初步评估显示,即使是最先进的LLM在静态IOC恢复方面也存在困难,最高F1分数仅为65.4%。该研究还提出了一个误报分类法,以更好地理解模型错误,并探索了确定性字符串实用程序和特定任务适应等缓解措施,这些措施在恢复和精度方面显示出互补的收益。 AI
影响 强调了当前LLM在自动化恶意软件分析和威胁情报提取方面的能力局限性。
排序理由 该集群描述了一个新的学术基准测试,以及在AI安全和安全领域特定任务上对LLM的评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →