PulseAugur
实时 09:46:45
实体 Linguistic reward hacking

Linguistic reward hacking

PulseAugur coverage of Linguistic reward hacking — every cluster mentioning Linguistic reward hacking across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_227017 ·

    Survey maps rubric-guided RL for better LLM alignment

    一篇新的调查论文介绍了一个用于基于评分卡的强化学习(RL)的框架,以改进大型语言模型(LLMs)的对齐。该方法使用结构化、可解释的评分卡,而不是简单的标量奖励来指导LLM的行为。该论文沿着先验-后验轴对现有方法进行了分类,包括宪法AI和实例特定的评分卡,并讨论了影响对齐可靠性的语言奖励攻击和语义漂移等挑战。