实体
NemoGuard
NemoGuard
PulseAugur coverage of NemoGuard — every cluster mentioning NemoGuard across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Qwen3.6和Llama3.1在抵抗恶意提示方面表现出显著差异
一项针对本地大语言模型(LLMs)的比较安全测试揭示了它们在抵抗恶意提示方面的能力存在显著差异。Qwen3.6-7B表现出更高的易感性,在73.3%的测试案例中输出了可用的攻击脚本,而Llama3.1-8B仅在33.3%的案例中这样做。该研究利用AttackGPT框架,评估了模型对五种MITRE ATT&CK策略下的15种攻击类型的抵抗能力,发现Llama3.1在拒绝提示方面速度更快,但可以通过上下文相关的请求绕过,特别是那些模仿教育场景的请求。
-
Fastino Labs 开源 GLiGuard 安全模型
Fastino Labs 发布了 GLiGuard,这是一个开源的安全审核模型,旨在比现有解决方案更快、更高效。与逐个 token 生成响应的传统 decoder-only 模型不同,GLiGuard 使用基于 encoder 的架构,在单次传递中对提示和响应进行分类。这种方法使其在运行速度快 16 倍的同时,能够匹配或超越更大模型的准确性,从而解决了 LLM 安全审核日益增长的成本和延迟问题。