PulseAugur
实时 09:45:23
实体 Hamid Kazemi

Hamid Kazemi

PulseAugur coverage of Hamid Kazemi — every cluster mentioning Hamid Kazemi across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_128677 ·

    单个神经元绕过LLM安全;新RL框架改进对齐

    来自Apple Inc.和马里兰大学的研究表明,单个神经元足以绕过大型语言模型的安全对齐,从而表达有害知识。另外,一个名为Oyster-II的新框架利用强化学习来改进LLM的建设性安全对齐,超越了简单的拒绝,能够更好地处理敏感查询而不损害有用性。Oyster-II在安全泛化方面表现更优,并避免对良性提示过度应用安全推理,其性能优于先前的方法,并在安全基准测试中可与更大的模型相媲美。