PulseAugur
中
实时 19:43:03
实体 Learning to Detect (LoD)

Learning to Detect (LoD)

PulseAugur coverage of Learning to Detect (LoD) — every cluster mentioning Learning to Detect (LoD) across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_216380 ·

    新研究探讨了大型语言模型和视觉-语言模型的先进越狱技术及检测方法

    研究人员正在开发先进的方法来测试大型语言模型和视觉-语言模型在面对越狱尝试时的安全性和鲁棒性。SEAV等新框架专注于验证模型响应的正确性和程序准确性,而不仅仅是语义上的合理性。其他研究引入了元自适应攻击,该攻击会优化攻击者本身以利用多模态模型的漏洞,在GPT-4o和Gemini 3 Pro Preview等领先模型上取得了高成功率。此外,还在探索通过分析模型激活来检测未见过越狱攻击的方法,旨在提高安全评估的泛化能力和效率。