研究人员开发了JevAdvBench,这是一个新颖的基准,旨在评估使用强化学习进行校准决策(RLCD)训练的模型的鲁棒性。该基准解决了衡量RLCD模型可靠性的挑战,特别是当相同的请求可能产生不同的输出且外部标签稀缺时。JevAdvBench采用独特的评分方法,将攻击性决策与模型自身的干净决策和重新运行结果进行比较,而不是依赖外部标签。该套件包含66个场景下的812个问题,以及近10,000个变体的黑盒攻击集,旨在识别RLCD应用中的漏洞。 AI
影响 该基准可能带来更强大、更值得信赖的AI系统,这些系统可以在没有人工监督的情况下做出关键决策。
排序理由 该集群描述了一篇介绍用于评估特定类型AI模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →