PulseAugur
实时 12:00:57
实体 Gaslighting Attacks

Gaslighting Attacks

PulseAugur coverage of Gaslighting Attacks — every cluster mentioning Gaslighting Attacks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_48873 ·

    新的煤气灯攻击揭示语音大语言模型准确率下降24%

    研究人员开发了一种新的方法来测试基于语音的大语言模型(LLMs)对操纵性提示的脆弱性,称为“煤气灯攻击”。这些攻击采用五种策略——愤怒、认知颠覆、讽刺、隐含和专业否定——来评估LLMs如何响应误导性或压倒性的输入。在五个不同的语音和多模态LLMs上,这些攻击导致平均准确率下降24.3%,凸显了当前语音AI系统显著的行为脆弱性,并强调了对更强大、更值得信赖的技术的需求。