研究人员开发了一种名为 LENS(基于级别的叙事压制评估)的新评估协议,用于评估机器去学习在阻止大型语言模型复制与虚假信息相关的叙事框架方面的有效性。该研究使用与俄乌冲突和美台关系相关的两个特定叙事,测试了四种指令调整模型——Lapa LLM、Gemma-12B、Qwen-14B 和 TAIDE-Gemma。结果表明,虽然去学习可以减少叙事再现,但也会导致实体恢复等意外副作用,这表明了叙事去学习的复杂性。 AI
影响 引入了一种评估和潜在改进大型语言模型对抗虚假信息安全性的新方法。
排序理由 该集群包含一篇详细介绍大型语言模型安全新评估协议的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Gemma-12B
- Lapa LLM
- Large language models
- LENS
- Qwen-14B
- Russia
- TAIDE-Gemma
- Taiwan
- Ukraine
- United States
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →