研究人员引入了一种名为“影响引导响应重写”的新方法,以改进大型语言模型(LLM)的训练数据归因(TDA)。该技术利用影响函数识别有影响力的训练样本,然后重写它们的响应以使其符合期望的行为,这种方法被证明比简单地重加权同一批样本更有效。研究表明,与传统的重加权相比,响应重写即使在安全相关任务中也能在LLM中产生更强、更一致的行为转变。 AI
影响 这项研究通过改进训练数据对模型输出的影响方式,可能带来更有效的方法来理解和控制LLM的行为。
排序理由 该集群包含一篇详细介绍LLM训练数据归因新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Functions
- large language models
- ScienceCast
- training data attribution
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →