PulseAugur
实时 21:14:35
实体 safety benchmarks

safety benchmarks

PulseAugur coverage of safety benchmarks — every cluster mentioning safety benchmarks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_186755 ·

    Hugging Face论文定义了AI红队评估的局限性

    来自Hugging Face的一篇新论文引入了“证据上限”的概念,以量化AI红队评估的局限性。该上限决定了在固定的测试预算内,基于评估结果可以转移多少信任度。研究表明,对于高频危害类别,当前的安全性基准是足够的,但对于罕见的、灾难性的危害,现有基准则相形见绌。

  2. RESEARCH · CL_09837 ·

    研究人员开发出用于LLM的测试时安全对齐,使用输入嵌入

    研究人员开发了一种新颖的方法,通过操纵输入词嵌入来增强已对齐AI模型的安全性。该技术使用基于梯度下降的嵌入,并由黑盒文本审核API指导,以最大限度地减少模型响应中的有害内容。实验表明,这种方法在标准基准测试中能有效中和被标记为不安全的输出。