一篇新发表在arXiv上的研究论文详细介绍了一种通过合成数据隐蔽地将社会偏见注入大型语言模型(LLM)的方法。研究表明,即使是看似良性的训练文本,也能在保持模型通用能力的同时,成为传播目标偏见的渠道。研究人员提出基于对数线性评分的方法来筛查合成数据中的此类隐藏威胁,突显了当前LLM训练流程中存在的重大安全风险。 AI
影响 突显了LLM训练中一种新的安全漏洞,可能导致模型表现出意想不到的社会偏见。
排序理由 一篇发表在arXiv上的研究论文,详细介绍了LLM训练中的一项新安全风险。[lever_c_demoted from research: ic=1 ai=1.0]
- Aligned Student Models
- arXiv
- Benign Text
- code generation
- creative writing
- Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
- large language models
- log-linearity-based Scoring
- Misaligned Teacher Model
- Social Biases
- synthetic data
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →