研究人员推出 MUDDLE,这是一个新的基准测试,旨在通过区分文档长度和干扰信息的影响来评估文档问答系统。该基准测试使用了 270 个经过人工标注的问题,每个问题在五种条件下进行测试:仅源文档、源文档加相似干扰项、源文档加随机干扰项。对 GPT-5 mini 的初步测试表明,主题相似的干扰项比等长随机干扰项对准确率的负面影响更大。 AI
影响 该基准测试通过突出干扰信息的影响,有望促使更强大的文档 QA 系统。
排序理由 该集群描述了一个用于评估 LLM 能力的新学术基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →