研究人员推出RH-Detect,这是一个旨在提高语言模型中奖励破解检测能力的统一基准。该基准将来自十一个公共数据集的数据整合到一个通用模式中,创建了一个包含92,761行、涵盖六种行为类别的的数据集。在包括多轮工具使用轨迹在内的开放式任务上进行评估时,性能最佳的现成语言模型达到了0.962的AUROC。然而,在多轮工具使用数据集上的准确率显著下降,这表明了在实际部署监控方面存在一个关键挑战。 AI
影响 RH-Detect旨在标准化奖励破解检测,可能带来更可靠、更安全的AI部署。
排序理由 该集群描述了一篇介绍AI安全研究基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →