PulseAugur
实时 21:59:35
实体 Adversarial prompts

Adversarial prompts

PulseAugur coverage of Adversarial prompts — every cluster mentioning Adversarial prompts across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_135330 ·

    新框架使用计算图诊断 LLM 越狱漏洞

    研究人员开发了一个新框架,用于理解大型语言模型 (LLM) 如何容易受到对抗性提示和越狱攻击。该方法使用成对的内部计算图,将提示特定的推理表示为潜在特征之间的结构化因果交互。通过对干净提示和受攻击提示的这些图进行对齐,研究揭示了攻击会系统性地改变模型的内部推理,例如抑制安全功能或重新路由计算路径。该框架允许对模型故障进行因果诊断,并在实验中表明,这些图中的结构偏差与不安全行为密切相关,从而能够进行有针对性的干预以提高模型鲁棒性。

  2. RESEARCH · CL_107710 ·

    新研究解决多语言LLM毒性检测与缓解问题

    两篇新研究论文探讨了在大型语言模型(LLM)中检测和缓解毒性的方法,特别关注多语言环境。第一篇论文调查了跨不同语言识别和减少有害输出的现有策略,强调了语言覆盖不均和有害定义具有文化特异性等挑战。第二篇论文介绍了ToxSearch-S,一种分布式进化搜索算法,旨在寻找引发毒性响应的对抗性提示,并通过MPI实现和改进的毒性检测与现有方法相比,展示了效率的提升。