PulseAugur
实时 17:14:30
English(EN) WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning

新的WILDTRACE基准测试AI在自然证据上的长上下文推理能力

研究人员推出WILDTRACE,一个旨在评估AI模型长上下文推理能力的新基准。与现有基准通常不自然地嵌入证据不同,WILDTRACE利用了在214份真实世界的长篇文档(如事件报告和文学叙事)中自然分散的证据轨迹。该基准包含481个任务,按七种不同的“证据几何形状”进行分类,这些形状反映了分析性阅读的关系需求。这种方法旨在更好地评估模型如何整合跨越遥远段落的信息,这是高风险分析任务的关键技能。 AI

影响 该基准将有助于研究人员开发出更能处理长文档复杂推理的AI模型,这对于现实世界的分析任务至关重要。

排序理由 该集群包含一篇介绍AI模型新基准的研究论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的WILDTRACE基准测试AI在自然证据上的长上下文推理能力

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Zixin Chen, Peng Liu, Haobo Li, Rui Sheng, Jianhong Tu, Xiaodong Deng, Fei Huang, Kashun Shum, Dayiheng Liu, Huamin Qu ·

    WILDTRACE:长上下文推理中的自然证据轨迹基准测试

    arXiv:2607.09328v1 Announce Type: cross Abstract: Answering complex questions over long documents frequently requires integrating evidence that the source itself disperses naturally across distant passages. In an incident report, the operating condition, design flaw, and missed s…

  2. arXiv cs.AI TIER_1 English(EN) · Huamin Qu ·

    WILDTRACE:长上下文推理中的自然证据轨迹基准测试

    Answering complex questions over long documents frequently requires integrating evidence that the source itself disperses naturally across distant passages. In an incident report, the operating condition, design flaw, and missed safety check that jointly explain a disaster may ap…