研究人员开发了HiveTraceGuard-Pro,这是一种新颖的生成式护栏模型,旨在保护大型语言模型免受提示注入和对抗性攻击。该模型是Qwen3-0.6B的一个0.6B参数LoRA微调版本,使用俄语和英语进行训练,并采用二元评分系统将响应分类为安全或不安全。虽然在一个基准测试中,其总体性能略低于得分最高的模型,但HiveTraceGuard-Pro在俄语任务中表现出强大的鲁棒性,取得了最高的俄语干净鲁棒性组合F1分数和近乎完美的提示注入召回率。与同类模型相比,该模型的平均延迟也最低,并且其权重在Hugging Face上公开可用。 AI
影响 这项研究引入了一个专门的护栏模型,可以提高LLM在多语言环境中对抗性攻击的安全性和鲁棒性。
排序理由 该集群包含一篇详细介绍新模型及其评估的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →