PulseAugur
中
实时 13:50:18
实体 safety benchmarks

safety benchmarks

PulseAugur coverage of safety benchmarks — every cluster mentioning safety benchmarks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_200152 ·

    新HiRoute框架增强LLM安全对齐

    研究人员开发了HiRoute,一个新颖的分层提示调优框架,旨在增强大型语言模型(LLM)的安全对齐。该框架采用输入自适应方法,利用一个轻量级分层路由器来区分有害和良性输入。对于风险输入,HiRoute结合了一个共享提示和一系列风险特定的提示专家,旨在提高各种基准测试中的安全率,同时最大限度地减少过度拒绝并保持通用任务性能。

  2. TOOL · CL_186755 ·

    Hugging Face论文定义了AI红队评估的局限性

    来自Hugging Face的一篇新论文引入了“证据上限”的概念,以量化AI红队评估的局限性。该上限决定了在固定的测试预算内,基于评估结果可以转移多少信任度。研究表明,对于高频危害类别,当前的安全性基准是足够的,但对于罕见的、灾难性的危害,现有基准则相形见绌。

  3. RESEARCH · CL_09837 ·

    研究人员开发出用于LLM的测试时安全对齐,使用输入嵌入

    研究人员开发了一种新颖的方法,通过操纵输入词嵌入来增强已对齐AI模型的安全性。该技术使用基于梯度下降的嵌入,并由黑盒文本审核API指导,以最大限度地减少模型响应中的有害内容。实验表明,这种方法在标准基准测试中能有效中和被标记为不安全的输出。