PulseAugur
实时 13:19:11
实体 human preference alignment

human preference alignment

PulseAugur coverage of human preference alignment — every cluster mentioning human preference alignment across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_91346 ·

    新的强化学习方法增强大型语言模型训练的稳定性和效率 · 跟踪 7 个来源

    研究人员开发了几种新方法来提高大型语言模型 (LLM) 中强化学习 (RL) 的稳定性和效率。STARE 通过根据惊奇度重新加权 token 级优势来解决策略熵崩溃问题,在推理基准测试中显示出更高的准确性。GrowthHacker 利用 LLM 代理自主优化离策略评估 (OPE) 代码,证明了改进 OPE 系统的可行性。ZPPO 将教师模型保留在提示中而不是策略梯度中,从而增强了小型学生模型的知识蒸馏。GD$^2$PO 通过过滤掉具有…

  2. TOOL · CL_15394 ·

    Anthropic 的 Claude Code 提升了开发人员的工作流程;新研究探讨了决策树和扩散模型

    一位用户分享了他们将整个编码工作流程成功过渡到 Anthropic 的 Claude Code 的积极体验,认为它非常有效且令人满意。另外,一项新研究提出通过将决策树视为流并将扩散模型视为流来将它们集成到一个统一的框架中。另一篇研究论文介绍了一种更有效的大模型评估 (LAM) 方法,该方法结合了人类偏好和模型对齐进行评估。