实体
Bon
Bon
PulseAugur coverage of Bon — every cluster mentioning Bon across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
arXiv论文提出新的推断时AI对齐方法
研究人员引入了在推断时对齐AI模型的新颖方法,为RLHF和DPO等传统微调技术提供了一种更有效率的替代方案。这些新方法,Best-of-Nash (BoN) 和 Nash Mirror Descent (NMD),通过处理一般偏好而非依赖单一标量奖励模型,解决了现有推断时方法的局限性。所提出的算法被表述为在两人零和博弈中寻找纳什均衡,并在各种数据集上的实证表现与微调模型相当或超越。
-
新的Best-of-Evidence框架通过部分验证改进AI模型选择
研究人员开发了一个名为Best-of-Evidence (BoE)的新框架,以改进模型输出的选择,特别是在视觉-语言任务中,这些任务的候选者并非总是可以完全验证。BoE解决了部分验证的场景,在这种场景下,只有响应的特定方面可以被检查,并且声明可能出现在具有冲突立场的多个候选者中。该框架利用候选因子图和有限的证据行动预算来优化最终选择,理论上展示了剩余证据能力如何影响改进以及共享查询如何提供效率提升。
-
新的时间回溯搜索提升了生成视频推理能力
研究人员推出了一种名为时间回溯搜索(TBS)的新颖方法,旨在改进生成视频推理。与现有在扩散过程中早期逻辑缺陷方面存在困难的单次尝试方法不同,TBS将搜索空间转移到时间轴上。这种迭代的生成-验证-重启循环允许模型将计算资源重新分配到扩展正确的轨迹,而不是丢弃已验证的进展。在算法、导航和机器人领域的实验中,TBS显著优于标准的Best-of-N采样,尤其是在单次尝试方法失败的分布外设置中。