一个名为ConsistencyAI的新基准已被开发出来,用于评估大型语言模型(LLMs)在回应不同人口群体的用户时在事实方面的一致性。该基准测试大型语言模型是否无论提问者的身份如何都能提供相同的事实信息。在对19个大型语言模型进行的实验中,事实一致性的得分范围为0.7896至0.9065,平均得分为0.8656。xAI的Grok-3表现最为一致,而较小的模型则不太一致。研究还发现,一致性因主题而异,就业市场的一致性最低,世界领导人的一致性最高。 AI
影响 凸显了大型语言模型中潜在的偏见以及对身份无关提示策略的需求。
排序理由 这是一篇介绍新基准以评估大型语言模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- ConsistencyAI
- DagsHub
- Gotit.pub
- Grok-3
- Hugging Face
- LLMs
- Peter Banyasz
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →