研究人员推出 KaliBench,一个旨在评估大型语言模型(LLM)为网络安全工具生成精确命令行界面(CLI)命令能力的新基准测试。该基准测试包含 1,642 个工具的 8,504 个查询-命令对,重点关注准确的工具选择和参数构建。目前开源模型在此任务上表现不佳,精确命令准确率低于 42%。然而,使用 KaliBench 的可验证奖励进行微调显著提高了 8B 模型的性能。 AI
影响 该基准测试通过为 CLI 命令生成提供标准化评估,有望加速开发更强大的网络安全运营 LLM。
排序理由 该集群包含一篇学术论文,介绍了一个用于评估 LLM 在特定任务上性能的新基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →