研究人员开发了一个名为CAP-Correctness的新框架,用于评估开放式问答系统生成的答案的语义正确性。该框架通过将答案分为八个有序类别,解决了现有指标的局限性,区分了完整且正确的响应与包含幻觉或矛盾等不准确信息的响应。该系统还包括用于训练自然语言推理模型的CAP-Statements,以及CAP,一个利用双向NLI为条件问答语句评分的基于参考的指标,在单调性测试中表现优于既有基线。 AI
影响 改进了对LLM生成答案的评估,能够更可靠地评估QA系统的能力。
排序理由 介绍QA系统新评估框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →