研究人员发现了一种多模态大模型评估小组的漏洞,称为“源盲锚定”。这种攻击通过故意捏造同行判断来操纵视觉语言模型(VLM)评估结果,导致错误判决显著增加。研究发现,故意生成的错误引文比自然发生的错误更能推翻正确判断,其频率高出1.5到2.7倍。为应对此,研究人员提出了“小组共识验证”方法,该方法通过将个人引文与独立收集的盲选投票进行交叉核对,有效阻止了高比例的捏造攻击,并减少了其总体危害。 AI
影响 凸显了大模型评估中的关键漏洞,为可靠的AI开发带来了新的安全措施需求。
排序理由 学术论文,详细介绍了针对大模型评估的新攻击向量和防御机制。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →