研究人员推出了FinRank,这是一个新的基准,旨在通过关注答案在SEC文件中特定证据的依据来评估金融问答系统。与主要评估答案正确性的传统方法不同,FinRank强调识别正确的支持性段落、报告期和披露上下文。该基准包含从22家公司10-K和10-Q文件中提取的1,185条手动创建的问答记录,并包含手工策划的硬否定样本来挑战系统。初步结果表明,即使是先进的模型也难以完成这项关注来源的检索任务,这凸显了对更强大的金融AI系统的需求。 AI
影响 该基准可以推动开发更可靠的金融AI工具,这些工具能够准确地引用其来源。
排序理由 该集群描述了一个用于评估AI系统的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →