PulseAugur
中
实时 10:24:49
实体 KaliBench

KaliBench

PulseAugur coverage of KaliBench — every cluster mentioning KaliBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_275207 ·

    新的 KaliBench 基准测试用于测试 LLM 生成网络安全 CLI 命令的能力

    研究人员推出 KaliBench,一个旨在评估大型语言模型(LLM)为网络安全工具生成精确命令行界面(CLI)命令能力的新基准测试。该基准测试包含 1,642 个工具的 8,504 个查询-命令对,重点关注准确的工具选择和参数构建。目前开源模型在此任务上表现不佳,精确命令准确率低于 42%。然而,使用 KaliBench 的可验证奖励进行微调显著提高了 8B 模型的性能。