一项对金融新闻NLP基准测试的新审计显示,存在严重的时间泄露问题,与按时间顺序划分相比,随机的训练-测试集划分将性能指标夸大了高达6.5倍。这种泄露在大模型和更丰富的特征下尤为明显。研究发现,只有并购新闻在接近时间顺序的评估下显示出积极信号,但该信号仅限于特定的语义上下文,并未迁移到更广泛的数据集。研究人员提倡将泄露审计作为金融NLP基准测试的强制性披露内容。 AI
影响 凸显了金融NLP基准测试评估中的关键缺陷,需要更严格的审计实践来可靠评估模型性能。
排序理由 该条目是一篇学术论文,详细介绍了NLP基准测试的新审计方法和发现。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- DeBERTa-v3-large
- FinBERT
- FNSPID
- Llama 3
- MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained Transformers
- Qwen2.5
- RoBERTa-large
- tf–idf
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →