研究人员推出WILDTRACE,一个旨在评估AI模型长上下文推理能力的新基准。与现有基准通常不自然地嵌入证据不同,WILDTRACE利用了在214份真实世界的长篇文档(如事件报告和文学叙事)中自然分散的证据轨迹。该基准包含481个任务,按七种不同的“证据几何形状”进行分类,这些形状反映了分析性阅读的关系需求。这种方法旨在更好地评估模型如何整合跨越遥远段落的信息,这是高风险分析任务的关键技能。 AI
影响 该基准将有助于研究人员开发出更能处理长文档复杂推理的AI模型,这对于现实世界的分析任务至关重要。
排序理由 该集群包含一篇介绍AI模型新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →