PulseAugur
实时 10:19:34
实体 preference alignment

preference alignment

PulseAugur coverage of preference alignment — every cluster mentioning preference alignment across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_191357 ·

    新的双层优化方法改进了LLM校准和泛化能力

    研究人员开发了一种新方法来改进大型语言模型(LLM)的校准,解决了因偏好对齐技术而常常出现的过度自信问题。这种新颖的方法,称为双层优化,通过最大化预测分布的熵来修改模型参数。这直接通过抑制过于集中的预测来对抗过度自信。该方法采用高效的一阶近似,使其能够扩展到LLM,并在问答任务中展示了改进的校准和域外泛化能力。