实体
AgentHarm
AgentHarm
PulseAugur coverage of AgentHarm — every cluster mentioning AgentHarm across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的提示注入检测技术利用跨领域方法
研究人员开发了七种新颖的提示注入攻击检测技术,超越了传统的模式匹配和微调Transformer分类器。这些新方法借鉴了法医语言学、生物信息学和欺骗技术等不同领域的灵感。prompt-shield v0.4.1版本整合了其中三种技术,在多个数据集上显著提高了检测率,尤其是在间接注入攻击方面,同时保持了较低的误报率。
-
新框架指导LLM代理修改计划,提高安全性
研究人员开发了TRIAD,一个用于LLM代理的新框架,该框架集成了Guardrail以提高安全性和实用性。与仅仅阻止不安全操作的传统Guardrail不同,TRIAD提供反馈以指导代理修改其计划,使其能够保留良性任务同时避免有害部分。实验表明,TRIAD显著降低了攻击成功率,并提供了比现有方法更好的安全-效用权衡。
-
新框架LiSA通过稀疏的失败数据增强AI护栏
研究人员开发了LiSA(Lifelong Safety Adaptation,终身安全适应)新框架,旨在通过从稀疏且嘈杂的失败数据中学习来改进AI护栏。LiSA使用结构化记忆从个体事件中进行泛化,结合了用于混合标签上下文的冲突感知规则,并采用证据感知置信门控。这种方法在PrivacyLens+和AgentHarm等基准测试中,即使在存在显著标签噪声的情况下,也始终优于现有的基于记忆的方法,为保护AI代理免受不可预测的现实世界风险提供了…