研究人员开发了VerTox,一个使用可验证的奖励引导强化学习来针对神经排序模型进行语料库投毒攻击的新框架。该方法将精心设计的文档注入语料库以操纵排序结果,在各种架构和商业嵌入模型上均显示出高成功率。生成的对抗性文档流畅且难以检测,通过破坏事实信息,显著降低了下游检索增强生成(RAG)应用的性能。 AI
影响 这项研究突显了AI排序系统潜在的漏洞,表明需要改进信息检索和RAG流程中对抗性攻击的防御措施。
排序理由 该集群描述了一篇新研究论文,详细介绍了一种针对神经排序模型进行语料库投毒攻击的新框架。
- arXiv
- LLMs
- retrieval-augmented generation
- RLVR
- VerTox
- information retrieval
- large language models
- neural ranking models
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →