PulseAugur
实时 06:31:19
English(EN) When do stereotypes affect LLM behaviour?

大型语言模型会保留刻板印象,但在用户互动中难以应用

一项最新研究探讨了大型语言模型(LLM)如何形成和利用刻板印象。研究人员发现,像Llama-3.2-3B和Qwen2.5-7B这样的小型开源模型表现出刻板印象行为,例如,当引导至较高的社会经济地位时,薪资建议会增加141%。即使是像GPT-5.6、Gemini 3.1 Pro和Claude Opus 5这样先进的模型,在被要求创建虚构角色时也表现出刻板印象的存在,根据普遍的社会偏见分配性别和种族。然而,当这些角色被呈现为寻求建议的用户时,前沿模型在很大程度上提供了通用回应,未能将内部刻板印象持续转化为量身定制的用户互动。 AI

影响 调查了大型语言模型如何内化并可能利用社会偏见,影响用户信任和公平性。

排序理由 对大型语言模型关于刻板印象的行为进行分析,而非直接发布或产品公告。

在 LessWrong (AI tag) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

大型语言模型会保留刻板印象,但在用户互动中难以应用

报道来源 [1]

  1. LessWrong (AI tag) TIER_1 English(EN) · Cat McGee ·

    刻板印象何时会影响大型语言模型的行为?

    <p><span>In my </span><a href="https://www.lesswrong.com/posts/zRKNd6ypTJYkoeFmK/what-gives-you-away-how-llms-form-opinions-of-you" rel="noreferrer"><span>last post</span></a><span>, I looked at what makes LLMs form opinions of their users: gender, age, socioeconomic status, educ…