PulseAugur
实时 07:26:22
实体 XSTest

XSTest

PulseAugur coverage of XSTest — every cluster mentioning XSTest across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_206119 ·

    PL-Guard架构将大语言模型接地与推理分离,以增强安全性

    研究人员推出了一种新颖的神经符号架构PL-Guard,旨在通过分离语义接地和策略推理来增强大语言模型(LLM)的安全性。该方法使用带有谓词和ProbLog规则的符号策略接口,其中本地LLM将提示-响应对接地为谓词概率,而ProbLog执行显式的概率规则推理。在XSTest基准上的评估表明,与基础模型相比,PL-Guard将不安全合规率从22.0%显著降低到0.5%,优于LLM作为裁判的基线。然而,这种改进伴随着更高的过度拒绝率,表明安…

  2. TOOL · CL_183121 ·

    大型语言模型安全基准因提示敏感性而低估了风险

    一篇新的研究论文指出,标准的基准测试可能低估大型语言模型(LLMs)的安全风险,因为它们依赖单一的规范提示。研究发现,在保持意图不变的情况下改变提示的表面形式,会显著增加 Claude、GPT-4o 和 Gemini 2.5 Pro 等模型的危险合规性。仅评估规范提示会遗漏相当一部分潜在的危险输出,这表明当前的安全性评估可能无法完全捕捉模型的漏洞。

  3. TOOL · CL_145799 ·

    新AI安全研究:激活探测器可检测有害请求

    一篇题为《纠缠之墙》的新研究论文提出,使用激活空间探测器作为检测潜在有害AI请求的方法。这些探测器在阻止合规攻击方面表现出高成功率,在跨模型家族的XSTest提示方面表现出中等成功率。虽然探测器在区分源对比方面达到了近乎完美的准确率,但当应用于新的、未见过的数据对时,其有效性有所下降,这表明它们作为广泛的风险探测器,而非最终的上下文裁决者。

  4. RESEARCH · CL_143640 ·

    新的 J-Space 协议内部评估人工智能模型安全性

    研究人员推出了一种新的协议 JADR,用于评估人工智能模型的内部安全机制。该方法在生成响应之前分析模型的雅可比空间(J-space),比传统的 LLM-as-judge 方法提供了更直接的评估。JADR 使用 SafetyAUC 指标量化内部安全性,比较了不同场景下模型及其量化版本的性能,并已应用于 Qwen3 和 Gemma 2 等模型。

  5. TOOL · CL_129350 ·

    新的操作系统内核原语增强LLM安全检查

    一种名为ProbeLogits的新型内核级操作已为AI原生操作系统开发,允许它们在生成token之前直接读取LLM的logit分布。该原语使操作系统能够在不需要单独的guard模型的情况下将代理行为分类为安全或危险,从而显著降低计算开销。在Qwen2.5-7B、Llama-3-8B和Mistral-7B等模型上的评估表明,在HarmBench和ToxicChat等基准测试上实现了高拦截率,性能与Llama Guard 3等现有guar…