一项名为Polistemics的新基准已被开发出来,用于评估大型语言模型(LLMs)在选举期间调解政治信息的有效性。该基准基于认识论谦逊理论,评估了LLMs在清晰度、噪声和一致性等各种信息条件下的表现。当应用于使用2025年德国和荷兰选举数据进行的三种最先进的LLMs时,研究发现,尽管模型在清晰信息方面表现良好,但在信息缺失、模糊或矛盾的情况下却举步维艰,并且倾向于降低政治语言的强度。这些问题似乎受到政党先验和输出语言的影响,表明可靠的中介是可能的,但目前模型尚未持续实现。 AI
影响 强调了LLMs在政治话语中潜在的风险以及对稳健评估框架的需求。
排序理由 该集群包含一篇介绍新LLM评估基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- DagsHub
- German Elections of 2002: Aftermath and Implications for the United States
- Hugging Face
- LLMs
- Polistemics
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →