研究人员推出了 MIST,这是一个旨在评估语言模型在多大程度上能够选择性地信任外部信号的新基准。该基准在四种条件下呈现推理项目:干净、误导性、正确上下文和不相关上下文。一项新指标 SC2W 衡量了误导性信号导致正确答案错误的频率。提出的 SCOPE 方法使用直接偏好优化 (DPO) 来训练模型处理所有四种条件下的失败情况,显著降低了对误导性信息的敏感性,同时保持了在可信上下文中的准确性。 AI
影响 这项研究可能带来更可靠的 AI 系统,这些系统能够更好地辨别可信信息和误导性信号。
排序理由 该集群描述了一篇介绍用于评估语言模型的新基准和方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →