研究人员开发了一个新的基准和数据集ECTs-100,用于评估大型语言模型(LLM)在可信地分析收益电话会议记录方面的能力。该基准侧重于依据性(确保声明有源文档引用支持)和正确性(评估提供信息的准确性)。研究发现,尽管LLM在分析依据性方面表现出色,但在正确性和识别证据不足方面存在困难,导致出现未经证实的声明。 AI
影响 该基准将帮助研究人员和开发人员提高LLM在金融分析中的准确性和可信度。
排序理由 这是一篇介绍用于评估LLM的新基准和数据集的研究论文。
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- earnings call transcripts
- ECTs-100
- Gotit.pub
- Hugging Face
- Influence Flower
- large-language models
- Litmaps
- ScienceCast
- scite Smart Citations
- S&P 500
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →