PulseAugur
实时 09:25:57
English(EN) FinRank: An Evidence-Grounded Benchmark for Financial Question Answering and Retrieval over SEC Filings

新的FinRank基准测试AI在金融答案中引用证据的能力

研究人员推出了FinRank,这是一个新的基准,旨在通过关注答案在SEC文件中特定证据的依据来评估金融问答系统。与主要评估答案正确性的传统方法不同,FinRank强调识别正确的支持性段落、报告期和披露上下文。该基准包含从22家公司10-K和10-Q文件中提取的1,185条手动创建的问答记录,并包含手工策划的硬否定样本来挑战系统。初步结果表明,即使是先进的模型也难以完成这项关注来源的检索任务,这凸显了对更强大的金融AI系统的需求。 AI

影响 该基准可以推动开发更可靠的金融AI工具,这些工具能够准确地引用其来源。

排序理由 该集群描述了一个用于评估AI系统的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的FinRank基准测试AI在金融答案中引用证据的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Sasan Mansouri, Daniel Saad, Mark Wahrenburg, Manu Weissel, Fabian Woebbeking ·

    FinRank:基于证据的金融问答与SEC文件检索基准测试

    arXiv:2608.07400v1 Announce Type: new Abstract: Financial question answering is typically evaluated by answer correctness, yet in SEC filings a plausible and even numerically correct answer can be grounded in the wrong evidence. Similar facts and disclosures recur across sections…