PulseAugur
实时 23:23:36
实体 content moderation

content moderation

PulseAugur coverage of content moderation — every cluster mentioning content moderation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_126583 ·

    LLM 防护栏:保护 AI 应用免受提示注入和数据泄露的侵害

    LLM 防护栏是保护 AI 应用的关键,它们充当用户输入和语言模型之间的保护层。这些防护栏有助于防止提示注入攻击(恶意指令会覆盖系统提示)的发生,并能检测和删除 PII 或 API 密钥等敏感数据。此外,它们还能强制执行内容策略,确保 AI 的响应符合组织指南,并防止机密信息泄露。

  2. RESEARCH · CL_115658 ·

    新的LLM越狱方法利用了超出提示词的系统性漏洞

    研究人员开发了新的方法来突破大型语言模型(LLM)的限制,这些方法利用了传统提示词级别攻击之外的漏洞。一种方法是模拟审核跟踪(Simulated Moderation Traces, SMT),它模拟一个审核工作流程来欺骗LLM生成有害内容,证明了上下文感知验证对于支持工具的系统至关重要。另一种方法MetaBreak利用LLM微调中使用的特殊标记来绕过安全对齐和内容审核,其性能优于现有技术,尤其是在与其他攻击策略结合时。

  3. TOOL · CL_93686 ·

    新的MIRAGE基准揭示了大型语言模型中加剧的反穆斯林偏见

    一个名为MIRAGE的新基准已被开发出来,用于评估大型语言模型中的反穆斯林偏见,它超越了简单的提示完成,评估了推理、代理决策和时序耦合条件。研究发现,思维链推理会加剧偏见,代理决策表现出不对称性,并且偏见会随着近期冲突背景的增加而增加。现有的缓解技术在这些条件下转移性很差。