Best of Nollywood Awards
PulseAugur coverage of Best of Nollywood Awards — every cluster mentioning Best of Nollywood Awards across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
测试时计算通过多数投票、验证器和顺序推理提高LLM准确性
测试时计算策略允许在推理过程中通过增加计算资源来提高语言模型的准确性,而不是训练更大的模型。诸如多数投票(自洽性)和N选一(使用验证器)等方法利用多个样本来提高性能。顺序方法,例如在OpenAI的o1/o3和DeepSeek-R1中看到的那些,通过在单个、扩展的推理过程中实现模型的自我纠正和回溯,进一步改进了这一点。
-
新基准揭示了大型语言模型个性化的局限性
研究人员推出了 Personalized RewardBench,这是一个旨在评估大型语言模型奖励模型在多大程度上能够捕捉个体用户偏好的新基准。现有的最先进奖励模型在个性化方面显示出显著的局限性,在预测用户偏好方面的准确率仅为 75.94%。与现有方法相比,新基准在诸如 Best-of-N 采样和 Proximal Policy Optimization 等任务中的下游性能显示出更高的相关性,从而证明了其在实际应用中评估奖励模型的效用。
-
新的Best-of-Evidence框架通过部分验证改进AI模型选择
研究人员开发了一个名为Best-of-Evidence (BoE)的新框架,以改进模型输出的选择,特别是在视觉-语言任务中,这些任务的候选者并非总是可以完全验证。BoE解决了部分验证的场景,在这种场景下,只有响应的特定方面可以被检查,并且声明可能出现在具有冲突立场的多个候选者中。该框架利用候选因子图和有限的证据行动预算来优化最终选择,理论上展示了剩余证据能力如何影响改进以及共享查询如何提供效率提升。
-
研究发现大多数事后验证算子未能提高冻结代码模型的准确性
一篇新发表在arXiv上的研究调查了针对小型、冻结代码的事后验证算子,发现大多数算子与Best-of-N等标准方法相比,并不能提高准确性。研究强调了“覆盖墙”和“能力剪刀”是关键限制。然而,“表达层恢复”方法通过恢复标准提取器丢弃的正确程序显示出希望,提高了DeepSeek-Coder-1.3B在HumanEval+等基准测试上的性能。
-
新的时间回溯搜索提升了生成视频推理能力
研究人员推出了一种名为时间回溯搜索(TBS)的新颖方法,旨在改进生成视频推理。与现有在扩散过程中早期逻辑缺陷方面存在困难的单次尝试方法不同,TBS将搜索空间转移到时间轴上。这种迭代的生成-验证-重启循环允许模型将计算资源重新分配到扩展正确的轨迹,而不是丢弃已验证的进展。在算法、导航和机器人领域的实验中,TBS显著优于标准的Best-of-N采样,尤其是在单次尝试方法失败的分布外设置中。