PulseAugur
实时 15:16:57
实体 Qwen2.5-Math-7B-Instruct

Qwen2.5-Math-7B-Instruct

PulseAugur coverage of Qwen2.5-Math-7B-Instruct — every cluster mentioning Qwen2.5-Math-7B-Instruct across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_20550 ·

    新的RLVR方法通过正负提示配对增强LLM推理能力

    研究人员开发了一种名为提示高效RLVR的新方法,可改进大型语言模型在推理任务上的训练。该技术侧重于选择同时提供积极锚点和来自罕见失败信号的提示,这与以往基于方差的方法不同。通过配对“难但可解”和“易但脆弱”的提示,并使用加权方法来放大成功和失败,该方法提高了样本效率,并在数学推理基准测试中取得了显著的性能提升。