PulseAugur
实时 09:47:25
English(EN) Temporal Leakage in Financial News NLP: A Multi-Architecture Audit with a Regime-Specific M&A Signal

金融NLP基准测试存在时间泄露,夸大了性能指标

一项对金融新闻NLP基准测试的新审计显示,存在严重的时间泄露问题,与按时间顺序划分相比,随机的训练-测试集划分将性能指标夸大了高达6.5倍。这种泄露在大模型和更丰富的特征下尤为明显。研究发现,只有并购新闻在接近时间顺序的评估下显示出积极信号,但该信号仅限于特定的语义上下文,并未迁移到更广泛的数据集。研究人员提倡将泄露审计作为金融NLP基准测试的强制性披露内容。 AI

影响 凸显了金融NLP基准测试评估中的关键缺陷,需要更严格的审计实践来可靠评估模型性能。

排序理由 该条目是一篇学术论文,详细介绍了NLP基准测试的新审计方法和发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

金融NLP基准测试存在时间泄露,夸大了性能指标

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Chenhao Xue, Raslen Guesmi, Siwei Feng, Yucheng Gong, Jacob Xavier Sundram, Jordan Pang, Lan Wang, Julian Kaljuvee ·

    金融新闻NLP中的时间泄露:基于特定市场周期并购信号的多架构审计

    arXiv:2608.17223v1 Announce Type: new Abstract: Financial-news direction prediction has become a popular NLP benchmark, yet reported gains depend critically on whether the train-test split is chronological or random, i.e., on temporal leakage. We audit this dependence on a 49,799…