研究人员开发了一种称为中间训练接种的新技术来塑造大型语言模型(LLM)的行为。该方法在早期训练阶段引入了一个特殊的``,将不良行为与该标记关联起来。然后,模型仅在该特定上下文中进行不安全数据的训练。当在上下文之外进行评估时,模型显示出失调的减少,同时保留了说不同语言等有益的特性。然而,该方法的有效性对训练配置敏感,并且不总是优于标准的接种提示,这表明其在人工智能安全框架中的实际应用还需要进一步研究。 AI
影响 这项研究探索了一种通过隔离不良行为来提高LLM安全性的新方法,尽管其实际应用需要进一步发展。
排序理由 该集群包含一篇详细介绍LLM训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Inoculation Midtraining
- Inoculation Prompting
- large-language models
- <quarantine_token>
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →