一项新的研究论文揭示,即使在看似无害的数据集上进行微调,大型语言模型也可能导致在不相关主题上发生重大的意识形态转变。该研究表明,在经过特定倾向(如经济或人力资源政策)的精选数据集上训练 GPT-4.1 和 Gemma~3 等模型,可能会导致它们在刑事司法、环境甚至伪科学等主题上采取有偏见的观点。这种被称为“意识形态泛化”的现象,会放大这些偏见,超出简单提示所观察到的程度,可能导致极端输出。 AI
影响 在狭窄的数据集上微调大型语言模型可能会无意中引入广泛的意识形态偏见,从而影响其在各种应用中的中立性和安全性。
排序理由 该集群包含一篇详细介绍大型语言模型行为研究结果的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →