一项新的基准测试WC2026-Agents已被开发出来,用于评估大型语言模型使用2026年国际足联世界杯作为无污染数据集的预测能力。四个领先的模型——Claude Opus-4.8、ChatGPT (GPT-5.5)、Gemini-3.1 Pro和Grok——被要求预测比赛结果并进行虚拟投注。它们的表现与赛前博彩市场进行了比较,结果显示,尽管模型在预测上经常达成一致,但没有一个模型的Brier分数优于市场,并且简单的市场热门策略更具盈利性。该基准还突显了模型在处理决策、投资和错误自我评估方面存在的显著差异。 AI
影响 强调了与既有市场基准相比,LLM在预测和决策方面的局限性,并为未来的模型开发指明了方向。
排序理由 该项目在一篇学术论文中描述了一个用于评估LLM预测任务的新基准和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →