一个名为 LFORLA 的新基准已被开发出来,用于评估大型语言模型(LLMs)预测选举结果的能力。该基准要求模型对未来的选举结果做出具体预测,例如2027年法国总统大选和2026年美国中期选举,而不是提供模糊的观点。然后,一个固定的裁判模型根据预测的明确性、相关背景的依据以及置信度的校准来评估这些预测,并将分数发布在排行榜上。 AI
影响 该基准提供了一种标准化方法来评估 LLMs 在复杂预测任务中的性能,有可能提高它们在政治分析和决策中的效用。
排序理由 该项目描述了一个用于评估 LLMs 在特定任务(选举预测)上的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- 2026 US midterms
- 2027 French presidential election
- France
- GLM-5.2
- LFORLA
- Nemotron 3 Ultra
- tencent/Hy3
- US
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →