对HELM安全基准(特别是HarmBench数据集)的一项新的心理测量审计表明,它未能有效衡量单一属性,如有害拒绝。该分析采用了多维项目反应理论和项目功能差异分析,揭示HarmBench分数不能一致地分离单一属性,并且来自不同开发者的模型即使在拒绝能力相似的情况下得分也可能不同。研究认为,跨数据集和项目的分数汇总可能会掩盖不同的危害行为,并且在用于模型比较之前,安全分数应被验证为衡量单一属性。 AI
影响 凸显了AI安全评估方法中潜在的缺陷,表明当前的基准可能无法准确反映模型行为。
排序理由 分析AI安全基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →