PulseAugur
实时 10:38:30
实体 CoSApien

CoSApien

PulseAugur coverage of CoSApien — every cluster mentioning CoSApien across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_62847 ·

    新的大语言模型对齐方法探索博弈论和可配置安全

    研究人员正在探索用于大语言模型(LLMs)安全对齐的新颖方法,超越了传统的擦除技术。一种方法将安全视为两个大语言模型之间的非零和博弈,一个攻击者和一个防御者,通过强化学习进行迭代训练。另一种方法提出了一种辩证方法,将“不安全”的知识整合到专门的专家中,并由一个轻量级路由器指导,以确保安全和信息丰富的输出。第三种方法引入了一个可配置的奖励模型,该模型可以适应不断发展的安全规范,在基准测试中无需额外的人工标注即可达到最先进的性能。