一篇新发表在arXiv上的研究论文指出了恶意提示分类器评估中存在的重大问题。该研究题为“当基准测试撒谎时:在真实分布变化下评估恶意提示分类器”,引入了一种“仅排除一个数据集”(Leave-One-Dataset-Out, LODO)的评估方法,该方法揭示了当前基准测试夸大了模型的泛化能力。研究人员发现,标准的交叉验证方法报告的准确性高于LODO方法,在包括Llama-3.1-8B、Gemma-3-27B和Qwen-3.5模型在内的各种大型语言模型上,准确性差距在1到25个百分点之间。该论文还指出,稀疏自编码器使用的相当一部分特征是依赖于数据集的捷径,并且常见的领域泛化技术未能缩小评估差距。 AI
影响 强调了当前大型语言模型安全评估中的关键缺陷,可能导致更强大的防御措施来抵御提示注入和越狱攻击。
排序理由 发表在arXiv上的研究论文,详细介绍了一种新的大型语言模型提示分类器评估方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Gemma 3:27B
- Hugging Face
- Leave-One-Dataset-Out
- Llama-3.1:8b
- Max Fomin
- Sparse Autoencoder for Unsupervised Nucleus Detection and Representation in Histopathology Images
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →