研究人员在法律检索增强生成(RAG)系统中识别并量化了一个名为“时间错位”的问题,即模型会错误地引用过时或未来的法律文件版本,而不是当前适用的版本。为解决此问题,他们开发了FiscalQA Pro,一个基于法国税法、包含93年间32,000多个条文版本和209个专家评审问题的版本化语料库的基准数据集。评估显示,现有模型在时间推理方面存在显著困难,没有模型能够准确检索到适用日期的版本。一个索引了多个版本的新型端到端检索器达到了98.3%的准确率,凸显了在法律AI应用中进行版本感知检索的重要性。 AI
影响 凸显了法律AI的关键局限性,需要进行版本感知检索以实现准确的法律文件分析。
排序理由 该集群包含一篇介绍用于评估AI系统的新基准和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- FiscalQA Pro
- French tax code
- Gemini 2.5 Pro
- Gotit.pub
- Hugging Face
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →