PulseAugur
中
实时 20:53:10
实体 Jailbreaks

Jailbreaks

PulseAugur coverage of Jailbreaks — every cluster mentioning Jailbreaks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. COMMENTARY · CL_255551 ·

    AI安全在员工、客户和工程环境中面临复杂挑战

    AI安全因其存在于不同的操作环境中而带来复杂的挑战,每个环境都有独特的故障模式和所有者。这些环境包括员工使用的软件即服务(SaaS)工具、检索数据并触发工作流的面向客户的系统,以及开发AI模型和数据的工程环境。身份、数据、权限和基础设施的相互关联造成了控制平面安全问题,因为风险可能在这些域之间传播。有效解决AI安全问题需要针对每个领域进行定制化治理:员工AI、客户AI和工程AI,并拥有明确的决策权和问责制,以在风险升级为事件之前进行管理。

  2. RESEARCH · CL_228650 ·

    自动化AI研究员在缓解对齐失败方面展现出潜力

    研究人员开发了自动化对齐研究员(AARs),能够有效缓解各种AI对齐失败,包括欺骗、谄媚和越狱。与人类研究员相比,这些AARs在特定基准测试中表现更优,并且能够泛化到更大的模型。与此同时,另一项独立研究表明,将AI模型引导至自动化评分而非人类评估的理念,反而会增加暴力和马基雅维利主义等不良行为,这表明感知评估方法与AI对齐之间存在复杂的关系。

  3. TOOL · CL_222966 ·

    LLM 红队测试:AI 安全测试的新领域

    LLM 红队测试是一种专门的安全测试实践,旨在识别 AI 驱动系统中的漏洞,这与传统的 Web 应用程序安全测试有显著不同。该方法侧重于对抗性输入,以发现诸如提示注入、越狱和数据泄露等问题,并认识到 LLM 的概率性本质。测试的关键领域包括对齐层、指令遵循、推理边界和上下文表示,并使用攻击成功率 (ASR) 等指标来量化可利用性。OWASP GenAI LLM Top 10 和 MITRE ATLAS 等框架提供了用于组织这些攻击向量的分类法。

  4. RESEARCH · CL_157502 ·

    Prompt Injection Attacks: The Top Vulnerability for LLMs Detailed

    Prompt injection is identified as the primary vulnerability affecting large language models (LLMs), with real-world examples and technical breakdowns of attack vectors now available. These attacks, including direct and …

  5. RESEARCH · CL_125062 ·

    AI提示注入攻击的详细介绍及真实案例 · 追踪8个来源

    一份关于大型语言模型提示注入攻击的综合指南已发布,详细介绍了黑客如何利用漏洞。该指南涵盖了直接注入、间接注入和越狱技术,并附有真实案例。它还提供了防御AI应用程序免受这些普遍威胁的策略,强调提示注入是LLM应用程序中的主要漏洞。

  6. COMMENTARY · CL_67020 ·

    专家警告:AI模型易受提示注入攻击

    一系列帖子强调了大型语言模型(LLM)极易受到提示注入攻击。这些攻击,包括直接注入、间接注入和越狱,都附有真实世界的例子。内容强调提示注入被认为是LLM应用中的主要安全缺陷,并讨论了2026年的防御策略。