一项新的研究论文介绍了一个名为TKFQA的基准测试,旨在评估大型语言模型(LLM)在异构知识源上进行推理时的事实一致性和顺序鲁棒性。该基准测试包含10,000多个基于表格、文本和知识图谱的问题解答对,专门用于测试多跳推理链和对输入顺序的敏感性。对14个LLM的评估揭示了当前模型在推理准确性和对输入变化的鲁棒性方面存在显著局限性。为解决此问题,该论文提出了ORLF,一个训练框架,增强了LLM保持知识特定偏差和编码拓扑语义的能力,从而提高了准确性并减少了由顺序引起的性能波动。 AI
影响 强调了当前LLM在处理复杂、多样化数据时的推理局限性,推动了对更鲁棒知识集成方法的研究。
排序理由 介绍LLM新基准和训练框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →