研究人员开发了一种方法来压力测试大型语言模型(LLM),例如GPT-4.1 mini,以评估它们正确引用财务证据的能力。该研究关注一个问题,即LLM可能产生数值上正确的计算,但引用了错误的财务角色或来源。通过在具有相同数字的单元格之间替换引用,研究人员分离了LLM的角色识别能力,揭示了检测不正确引用与支持有效引用之间的权衡。该评估框架旨在使基于LLM的财务助手能够独立评估数值正确性、引用角色支持和接受结果。 AI
影响 这项研究通过提高LLM准确引用证据的能力,可能带来更可靠的基于LLM的财务分析工具。
排序理由 该集群包含一篇详细介绍LLM新评估方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- GPT-4.1 mini
- Hugging Face
- Jevíčko
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →