PulseAugur
实时 09:16:39

新的XL-DocBench基准测试LLM在超长文档理解能力

研究人员推出了XL-DocBench,这是一个旨在评估大型语言模型在理解超长文档方面能力的新基准。该基准包含超过1500个问题,来源于年报和临床指南等专业领域,文档长度可达2303页。XL-DocBench要求模型不仅能定位信息,还能综合多页和多文档的证据,并解释表格、图表和图形,其中相当一部分问题需要多文档证据。初步结果表明,当前的LLM在处理如此广泛的上下文和复杂的推理任务方面仍面临挑战。 AI

影响 该基准将推动能够处理和推理广泛专业文档的LLM的发展,这对于合规、金融和医疗保健等领域的应用至关重要。

排序理由 该集群包含一篇介绍用于评估LLM能力的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的XL-DocBench基准测试LLM在超长文档理解能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Ruichun Ma, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo ·

    XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

    arXiv:2608.00036v1 Announce Type: new Abstract: Real-world document tasks often ask professionals to answer questions from annual reports, regulations, clinical guidelines, and technical manuals that span hundreds or thousands of pages. Some questions also require comparing relat…