研究人员推出了 HalluTruthQA,这是一个新的细粒度基准,旨在评估阿拉伯语问答大型语言模型中的幻觉检测、定位和解释能力。该基准包含 2,400 个专家策划的跨四个领域的示例,提供详细的注释,包括字符级别的错误跨度以及针对错误答案的人工编写的解释。对四个开源大型语言模型的评估显示,它们在不同任务上的表现各不相同,表明当前模型在全面的幻觉评估方面存在困难,突显了超越简单检测、转向更细致评估的必要性。 AI
影响 该基准有望推动阿拉伯语模型在事实准确性和可靠性方面的改进。
排序理由 该集群描述了一篇介绍用于评估大型语言模型能力的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →