PulseAugur
中
实时 06:52:07
实体 SSRFT

SSRFT

PulseAugur coverage of SSRFT — every cluster mentioning SSRFT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_284257 ·

    新的SSRFT框架内化安全角色以实现稳健的LLM安全对齐

    研究人员引入了一个名为Supervised Safe-Role Fine-Tuning (SSRFT)的新框架,以改进大型语言模型 (LLM) 的安全对齐。与专注于明确拒绝模式的传统方法不同,SSRFT将安全重新定义为预定义安全角色的内化。该方法使用源自心理测量问题和有限越狱提示的安全角色问答数据集来合成角色一致的响应。实验表明,SSRFT能够实现更稳健且可泛化的安全对齐,减少过度拒绝并保留模型能力。