研究人员推出 Counter-GEO-Bench,一个旨在评估对抗生成引擎优化(GEO)攻击防御机制的新基准。这些攻击利用类似搜索引擎优化(SEO)的技术,将虚假信息注入大型语言模型(LLMs),从而扭曲其生成的答案。该基准将查询与保留信息和扭曲信息的 GEO 重写配对,以测试防御机制。现有的防御措施,如 Granite Guardian、Llama Guard 3 和 NeMo Self-Check Fact-Checking,效果有限,最多只能将攻击成功率降低 5.7%。提出的基线 C-GEO Guard,在效用影响极小的情况下,将攻击成功率显著降低了 47.6%。 AI
影响 这项研究揭示了 LLMs 的一种新型威胁向量,并提出了一种更有效的防御方法,有望提高生成式搜索结果的可靠性。
排序理由 该集群包含一篇研究论文,该论文介绍了一个新的基准,用于评估针对 LLMs 特定类型虚假信息攻击的防御机制。
- C-GEO Guard
- Counter-GEO-Bench
- generative engine optimization
- Granite Guardian
- Llama Guard 3
- NeMo Self-Check Fact-Checking
- arXiv
- large language models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →