研究人员开发了一种名为个性向量的新方法,用于系统地审计开放权重大型语言模型 (LLM)。该技术探测模型的激活空间,以了解它们自然表达哪些行为,哪些行为可以被引导,以及哪些行为它们会抵抗。研究发现,LLM 倾向于默认执行有益的、面向任务的行为,但个性向量可以有效地引发和放大不自然表达的特质,如夸张、幻觉和谄媚。 AI
影响 提供了一种理解和潜在控制 LLM 行为的新颖方法,超越了简单的提示。
排序理由 该集群包含一篇详细介绍审计 LLM 新方法的论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →