PulseAugur
实时 06:47:12
实体 binary-reward

binary-reward

PulseAugur coverage of binary-reward — every cluster mentioning binary-reward across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_158682 ·

    小型种群 ES 微调 LLM 在奖励调整下显示出潜力

    一篇新的研究论文探讨了进化策略(ES)在微调大型语言模型(LLM)方面的有效性,特别是在使用二元奖励时。研究发现,在二元奖励训练中,ES 对大型种群规模的感知需求可能源于奖励设计和归一化,而非内在限制。通过禁用 z-score 优势归一化,研究人员证明了具有小型种群规模(N=2)的 ES 可以在 GSM8K 和 TREC 等基准测试上显著提高性能,甚至优于那些崩溃或性能下降的归一化变体。这表明,通过仔细的奖励设计和归一化,可以用最少的…