两篇新研究论文探讨了大型语言模型(LLMs)如何编码和延续刻板印象。第一篇论文STEREODISCO使用了一个改编自社会心理学的框架来识别LLM内部表征中的刻板印象轴,发现LLaMA-3-8B-Instruct和Mistral-7B-Instruct等模型在社会群体刻板印象上比人类感知更一致。第二篇论文引入了刻板印象到决策(S2D)框架来评估LLM中的区域偏见,特别关注中国,并揭示这些模型在感知温暖度和能力方面存在系统性区域偏见,这与区域发展指标相关,并且在不同的语言提示下保持稳定。 AI
影响 强调了超越性能指标,需要对LLM进行更细致的评估,关注其社会偏见和传播有害刻板印象的潜力。
排序理由 在arXiv上发表的两篇学术论文,详细介绍了评估LLM中刻板印象和区域偏见的新方法。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- China
- competency
- Education
- English
- large language models (LLMs)
- Occupation
- social interaction
- Standard Chinese
- Stereotypes-to-Decisions (S2D)
- Warmth
- LLaMA-3-8B-Instruct
- LLMs
- Mistral-7B-Instruct
- Osgood
- social psychology
- STEREODISCO
- WordNet
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →