PulseAugur
中
实时 22:58:37

新基准JevAdvBench测试RLCD模型鲁棒性

研究人员开发了JevAdvBench,这是一个新颖的基准,旨在评估使用强化学习进行校准决策(RLCD)训练的模型的鲁棒性。该基准解决了衡量RLCD模型可靠性的挑战,特别是当相同的请求可能产生不同的输出且外部标签稀缺时。JevAdvBench采用独特的评分方法,将攻击性决策与模型自身的干净决策和重新运行结果进行比较,而不是依赖外部标签。该套件包含66个场景下的812个问题,以及近10,000个变体的黑盒攻击集,旨在识别RLCD应用中的漏洞。 AI

影响 该基准可能带来更强大、更值得信赖的AI系统,这些系统可以在没有人工监督的情况下做出关键决策。

排序理由 该集群描述了一篇介绍用于评估特定类型AI模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准JevAdvBench测试RLCD模型鲁棒性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jianyi Hu, Hangtao Zhang, Yi Liu, Yeqi Zeng, Li Zeng, Xianlong Wang, Rui Wang, Leo Yu Zhang ·

    JevAdvBench:用于校准决策模型的强化学习的基准和黑盒攻击

    arXiv:2609.31142v1 Announce Type: cross Abstract: Models trained with reinforcement learning for calibrated decisions (RLCD), such as Jev, answer a typed question about an input, the state, with a probability, a choice, or a score, and software acts on the answer without a person…