PulseAugur
实时 20:19:33
English(EN) FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting

新基准FinBench评估LLM在金融预测中的校准能力

研究人员推出FinBench,一个旨在评估大型语言模型(LLM)在金融预测中校准和不确定性质量的新基准。与关注语义理解或点准确性的现有基准不同,FinBench通过严格的时间门控以防止前视偏差,专门解决了真实市场的时间限制和非平稳性问题。该基准利用严格的评分规则,如Brier分数和Winkler区间分数,来惩罚过度自信并评估模型预测金融回报概率和预测区间的准确性。 AI

影响 该基准通过改进LLM处理不确定性和时间数据的能力,有望带来更可靠的金融领域人工智能系统。

排序理由 该条目描述了一个用于评估特定领域(金融预测)LLM的新基准,这是一项研究贡献。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准FinBench评估LLM在金融预测中的校准能力

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Rishab Ghosh, Vinay Devarakonda ·

    FinBench:用于 Agentic 金融预测的时间门控校准和不确定性基准测试

    arXiv:2607.16229v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly used as components of agentic systems that observe, plan, and act. In finance, even "assistive" systems become decision-relevant once their outputs are used to size trades or allocate …