引入了两个新基准DFAH-Bench和FinBench,用于评估AI代理在金融决策中的表现。DFAH-Bench侧重于衡量代理可观察到的行为不稳定性,发现即使决策一致性高的模型在其工具使用轨迹中也可能表现出显著的分歧。另一方面,FinBench通过在严格的时间门控下评估概率校准和不确定性质量,以防止前视偏差,从而解决金融预测中的置信度-能力差距。这两个基准旨在为在复杂金融环境中运行的AI代理提供更鲁棒的评估方法。 AI
影响 这些基准旨在通过关注稳定性和校准性来提高AI代理在金融应用中的可靠性和可信度。
排序理由 两篇介绍AI代理评估新基准的学术论文。
- alphaXiv
- arXiv
- Brier score
- CatalyzeX
- DagsHub
- FinBench
- Gotit.pub
- Hugging Face
- LLMs
- ScienceCast
- Winkler interval score
- DFAH-Bench
- Raffi Khatchadourian
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →