PulseAugur
实时 17:21:27
实体 WildJailbreak

WildJailbreak

PulseAugur coverage of WildJailbreak — every cluster mentioning WildJailbreak across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_230863 ·

    BenchMIRT方法揭示LLM基准测试的真实测量内容 · 追踪2个来源

    研究人员推出了一种名为BenchMIRT的新方法论,旨在通过分析单个提示来剖析大型语言模型(LLM)在基准测试上的表现。该方法受项目反应理论(IRT)启发,旨在区分构成模型在特定任务得分的各种潜在能力,例如安全性和通用推理能力。通过将多维IRT(MIRT)应用于100个LLM在16个基准测试上的数据,BenchMIRT揭示,一些旨在衡量社会偏见的基准测试(如BBQ)比以往认为的更接近通用推理能力。

  2. TOOL · CL_193471 ·

    研究发现,大型语言模型安全探测可跨模型家族泛化

    一项新研究重现并扩展了先前关于使用潜在空间安全探测来检测大型语言模型中有害提示的研究。研究人员发现,在 LLaMA-3.1-8B、Gemma-4-E4B、Mistral-7B-v0.3 和 Qwen2-7B 等模型的激活上训练的轻量级 MLP 探测器,可以跨不同模型家族和规模进行泛化。他们的实验还表明,无论推理过程中使用的随机种子如何,最终的 token 潜在向量在不同架构之间保持一致。

  3. TOOL · CL_183233 ·

    新的AI安全方法允许模型生成和内化自己的指南

    研究人员开发了一种名为“自导自适应安全对齐”(SGASA)的新方法,使推理模型能够生成和内化自己的安全指南。该方法包括模型创建指南,根据自身错误进行改进,然后进行自我评估以选择最佳版本。应用时,这些上下文内指南显著提高了Qwen3模型的安全性并降低了过度拒绝率,内化后的指南即使在没有推理时提示的情况下也能保持这些收益。