PulseAugur
中
实时 13:09:16
实体 Best-of-$N$

Best-of-$N$

PulseAugur coverage of Best-of-$N$ — every cluster mentioning Best-of-$N$ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_218035 ·

    新研究详细介绍了 AI 推理管道中的“安全漏洞利用”

    一篇新研究论文介绍了 AI 推理管道中的“安全漏洞利用”概念,即通过了学习到的安全模型的输出仍然可能违反真正的安全标准。这源于两阶段的失败:不完美的安全性代理污染了可接受输出的集合,然后奖励最大化会放大这种污染。该论文在约束 Best-of-$N$ 采样中推导了这种现象的界限,表明即使代理错误很小,随着 $N$ 的增长,安全漏洞利用的可能性也越来越大。虽然覆盖控制方法可以限制放大,但它们无法完全修复被污染的可行集,这凸显了在推理过程中…

  2. RESEARCH · CL_79549 ·

    新方法增强LLM推理时的对齐

    研究人员开发了在推理过程中改进大型语言模型对齐的新方法。一种名为BlendIn的方法使用概率模型混合来整合来自多个模型的知识,通过质量感知加权稳定对齐并弱化不可靠的指导。另一种方法,梯度引导奖励优化(GGRO),利用梯度信号在高度不确定区域注入提示令牌,从而引导生成而非仅仅重新排序。第三种观点将奖励模型优化视为Stackelberg博弈,提出奖励塑造来近似最优模型并提高用户效用,同时减轻奖励操纵。