研究人员开发了一个名为Probity的新基准,用于衡量语言模型在回答有关文档的问题时的不稳定性。该基准包含60个任务和470个项目,均来自风险融资文件,结果显示模型有时会对同一文档的同一问题给出不同的答案。对语料库的审计发现了一个缺陷,即回答问题至关重要的证据在提供给模型的文本窗口中缺失,导致不稳定性增加。研究发现,即使在尝试纠正这些缺失证据后,模型不稳定性仍然存在,这表明文档基础基准在揭示模型稳定性方面存在局限性。 AI
影响 强调了当前LLM评估方法可能存在的问题,以及对文档基础任务进行更鲁棒基准测试的必要性。
排序理由 该集群包含一篇详细介绍评估语言模型行为新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →