一个名为LiveMacroEval的新基准已被开发出来,用于评估大型语言模型(LLMs)的实时宏观经济预测能力。该基准旨在抵抗数据污染,评估LLM代理在发布前窗口期内对十六项美国宏观经济指标的每小时预测。将LLMs的表现与机构预测、专业共识和ARIMA基线进行比较,发现总体准确性在这些基准之间具有可比性。 AI
影响 大型语言模型在实时经济预测方面展现出潜力,可与专家人类分析相媲美。
排序理由 该集群描述了一篇介绍用于评估LLM能力的新型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Auto ARIMA
- Bloomberg ECOS
- consumer price index
- Federal Reserve System
- gross domestic product
- Hugging Face
- Large language model
- LiveMacroEval
- Polymarket
- U.S.
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →