研究人员推出了XL-DocBench,这是一个旨在评估大型语言模型在理解超长文档方面能力的新基准。该基准包含超过1500个问题,来源于年报和临床指南等专业领域,文档长度可达2303页。XL-DocBench要求模型不仅能定位信息,还能综合多页和多文档的证据,并解释表格、图表和图形,其中相当一部分问题需要多文档证据。初步结果表明,当前的LLM在处理如此广泛的上下文和复杂的推理任务方面仍面临挑战。 AI
影响 该基准将推动能够处理和推理广泛专业文档的LLM的发展,这对于合规、金融和医疗保健等领域的应用至关重要。
排序理由 该集群包含一篇介绍用于评估LLM能力的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →