研究人员推出FinBench,一个旨在评估大型语言模型(LLM)在金融预测中校准和不确定性质量的新基准。与关注语义理解或点准确性的现有基准不同,FinBench通过严格的时间门控以防止前视偏差,专门解决了真实市场的时间限制和非平稳性问题。该基准利用严格的评分规则,如Brier分数和Winkler区间分数,来惩罚过度自信并评估模型预测金融回报概率和预测区间的准确性。 AI
影响 该基准通过改进LLM处理不确定性和时间数据的能力,有望带来更可靠的金融领域人工智能系统。
排序理由 该条目描述了一个用于评估特定领域(金融预测)LLM的新基准,这是一项研究贡献。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Brier score
- CatalyzeX
- DagsHub
- FinBench
- Gotit.pub
- Hugging Face
- LLMs
- ScienceCast
- Winkler interval score
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →