研究人员开发了一种更有效的方法,利用项目反应理论(IRT)来评估语言模型的安全性。这种心理测量学方法应用于六个常见的安全基准测试,表明IRT比传统的静态方法更能揭示结构性见解并更有效地区分模型。自适应项目选择(为每个模型动态选择相关的测试项目)可以将评估成本降低高达99.9%,同时保持高排名准确性。此外,一种用于选择信息性项目固定子集的实用程序,作为自适应测试的静态替代方案,提供了显著的成本节约。 AI
影响 能够更高效、更准确地评估AI安全性,有望加速更安全AI系统的开发和部署。
排序理由 详细介绍AI安全基准测试新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AIR-BENCH 2024
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Item Response Theory
- Mirian Silva Rossi
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →