PulseAugur
中
实时 03:44:59
实体 Activation-Guided GCG

Activation-Guided GCG

PulseAugur coverage of Activation-Guided GCG — every cluster mentioning Activation-Guided GCG across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_139618 ·

    新研究探测并突破了大型语言模型的安全机制

    研究人员开发了新的方法来探测并可能突破大型语言模型的安全机制。通过使用激活引导的对抗性后缀,他们发现安全表征分布在整个模型中,而不是局限于某一点。引入了一种名为Soft-GCG的技术,该技术显著加快了这些攻击的优化过程。虽然较小的模型仍然容易受到攻击,但在测试的计算约束下,经过更广泛安全训练的较大模型表现出更强的抵抗力。

  2. TOOL · CL_151174 ·

    新方法探测并打破大型语言模型的安全表征

    研究人员开发了新的方法来探测并可能打破大型语言模型中的安全机制。通过分析模型如何拒绝某些提示,他们发现安全表征分布在模型的各个层,而不是局限于某一点。他们的新技术 Activation-Guided GCG 直接针对这些内部拒绝方向,比以前的方法更有效。此外,一种名为 Soft-GCG 的连续松弛技术显著加快了优化速度,同时提高了攻击成功率,但更大、经过更广泛训练的模型显示出更强的抵抗力。