PulseAugur
中
实时 18:42:24
实体 TempJail

TempJail

PulseAugur coverage of TempJail — every cluster mentioning TempJail across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_212014 ·

    新的AI越狱方法利用了时间和描述性漏洞

    研究人员开发了新的方法来绕过AI模型的安全过滤器,这些方法同时针对大型视觉语言模型(LVLMs)和文本到图像(T2I)模型。一种名为TempJail的技术,通过操纵字幕时间和调度来引发有害响应,从而利用LVLMs的时间漏洞。另一种名为Etch的方法,通过将有害文本嵌入生成的图像中来针对T2I模型,绕过了传统的基于视觉的安全措施。这两种方法在绕过当前AI安全对齐方面都取得了显著的成功率。

  2. RESEARCH · CL_216380 ·

    新研究探讨了大型语言模型和视觉-语言模型的先进越狱技术及检测方法

    研究人员正在开发先进的方法来测试大型语言模型和视觉-语言模型在面对越狱尝试时的安全性和鲁棒性。SEAV等新框架专注于验证模型响应的正确性和程序准确性,而不仅仅是语义上的合理性。其他研究引入了元自适应攻击,该攻击会优化攻击者本身以利用多模态模型的漏洞,在GPT-4o和Gemini 3 Pro Preview等领先模型上取得了高成功率。此外,还在探索通过分析模型激活来检测未见过越狱攻击的方法,旨在提高安全评估的泛化能力和效率。