PulseAugur
实时 08:56:38
实体 Active Attention Probing

Active Attention Probing

PulseAugur coverage of Active Attention Probing — every cluster mentioning Active Attention Probing across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_193579 ·

    新研究发现 AI 安全评分错误地对越狱进行排名

    一篇新发表在 arXiv 上的论文质疑了用于评估 AI 模型有害性的内部安全评分的有效性。研究表明,这些评分可能具有误导性,因为它们可能会错误地将成功的越狱排名为比失败的越狱危害更小。这种情况的发生是因为评分机制可能无法准确反映提示的真实有害意图,特别是当模型的输出被修改或“包装”时。研究发现,这个问题在各种模型和攻击方法中都存在,这表明需要改进评估技术。