PulseAugur
实时 11:15:02
实体 KL-SFT

KL-SFT

PulseAugur coverage of KL-SFT — every cluster mentioning KL-SFT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_167205 ·

    研究发现大型语言模型任务适应会显著改变对齐

    一项发表在arXiv上的新研究调查了将大型语言模型(LLMs)适应特定任务如何影响其与安全和道德准则的对齐。研究人员评估了监督微调(SFT)和可验证奖励强化学习(RLVR)等方法,发现RLVR引起的对齐变化最小,而SFT在安全、事实性和社会危害等多个领域导致显著的行为和表征漂移。研究强调,在大型语言模型的训练后过程中,需要进行多维度的对齐评估作为标准。