研究人员开发了VerTox,一个新颖的框架,它使用可验证的奖励引导强化学习来投毒神经排序模型所使用的语料库。该方法训练紧凑型LLM生成恶意文档,这些文档会扭曲排序行为并损害检索增强生成(RAG)等下游应用。实验表明,VerTox在各种排序架构和商业嵌入模型上实现了高攻击成功率,生成流畅且难以检测的对抗性文档,其性能优于目标文档。 AI
影响 引入了针对检索系统的新攻击向量,可能影响AI驱动的信息访问的可靠性。
排序理由 学术论文,详细介绍了一种攻击AI系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →