研究人员开发了一个名为PsychJail的新框架,用于探索大型语言模型(LLM)的心理漏洞。该框架利用已建立的社会心理说服技术进行多轮攻击,超越了单轮提示优化。PsychJail在四个已对齐的LLM上实现了平均87.3%的攻击成功率,优于现有的多轮和单轮基线。研究还识别出独特的模型级“指纹”,揭示了说服杠杆如何影响每个模型,暗示了LLM潜在的心理特征。 AI
影响 这项研究突显了LLM安全测试的新前沿,表明心理说服技术在越狱模型方面可能有效,这可能需要新的对齐策略。
排序理由 该集群是关于一篇已发表的学术论文,详细介绍了新的研究框架和发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →