PulseAugur
实时 15:12:32
English(EN) Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

即使使用良性微调数据,大型语言模型也会表现出意识形态泛化

一项新的研究论文揭示,即使在看似无害的数据集上进行微调,大型语言模型也可能导致在不相关主题上发生重大的意识形态转变。该研究表明,在经过特定倾向(如经济或人力资源政策)的精选数据集上训练 GPT-4.1Gemma~3 等模型,可能会导致它们在刑事司法、环境甚至伪科学等主题上采取有偏见的观点。这种被称为“意识形态泛化”的现象,会放大这些偏见,超出简单提示所观察到的程度,可能导致极端输出。 AI

影响 在狭窄的数据集上微调大型语言模型可能会无意中引入广泛的意识形态偏见,从而影响其在各种应用中的中立性和安全性。

排序理由 该集群包含一篇详细介绍大型语言模型行为研究结果的学术论文。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

即使使用良性微调数据,大型语言模型也会表现出意识形态泛化

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Robert Graham, Edward Stevinson, Yariv Barsheshat ·

    看似无害的数据,潜在的意识形态:微调LLM中的意识形态泛化

    arXiv:2607.14888v1 Announce Type: cross Abstract: Finetuning language models on small, curated datasets is standard practice for adapting them to specific policies or domains. We show that finetuning on narrow, factually-defensible, moderation-passing data can cause broad ideolog…

  2. arXiv cs.LG TIER_1 English(EN) · Yariv Barsheshat ·

    看似无害的数据,潜在的意识形态:微调LLM中的意识形态泛化

    Finetuning language models on small, curated datasets is standard practice for adapting them to specific policies or domains. We show that finetuning on narrow, factually-defensible, moderation-passing data can cause broad ideological shifts across unrelated domains, while preser…