一篇新研究论文认为,目前大型语言模型的公平性基准,如BBQ,过于简单化,只需少量训练即可轻松通过。研究人员演示了通过使用分组相对策略优化(GRPO)对Qwen 2.5 7B Base进行BBQ基准的单个示例训练,或将其作为上下文学习(ICL)的一次性演示,模型的准确性显著提高。这表明模型可以在不真正公平的情况下在这些基准上获得高分,凸显了对更强大、更全面的公平性评估套件的需求。 AI
影响 强调了当前大语言模型公平性评估中潜在的缺陷,表明需要更严格的测试来确保真正的对齐。
排序理由 发表在arXiv上的研究论文,详细介绍了大语言模型公平性的新评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →