PulseAugur
实时 11:14:51
实体 BOPTR

BOPTR

PulseAugur coverage of BOPTR — every cluster mentioning BOPTR across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_235908 ·

    RLVR 会在贪婪指标未检测到的情况下降低 AI 搜索能力

    一项新的分析显示,仅结果强化学习(RLVR),也称为 GRPO,会损害 AI 模型的基础能力,尤其是在搜索增强任务中,而标准的贪婪准确性指标无法检测到这一点。研究人员开发了一个受控系统来研究这种故障模式,发现虽然贪婪准确性可能看起来有所提高或保持稳定,但模型执行复杂任务的能力可能会大大降低。该研究表明,评估者应纳入 pass@k 等基于采样的指标来检测这些隐藏的退化,因为如果基础模型的能力已被侵蚀,测试时搜索可能不是可靠的后备方案。