PulseAugur
实时 17:31:12
实体 ResearchQA

ResearchQA

PulseAugur coverage of ResearchQA — every cluster mentioning ResearchQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_206052 ·

    新的SARA方法通过减轻评分标准干扰来提高LLM裁判的一致性

    研究人员开发了一种名为自锚定评分标准对齐(SARA)的新方法,以解决大型语言模型(LLM)裁判中的评分标准干扰问题。当LLM在单次评估中处理多个评分标准时,会发生这种干扰,导致判决不一致。SARA利用模型自身的单评分标准判断作为稳定锚点,并采用在线自蒸馏来对齐多评分标准的推理过程。该方法已在Qwen3和Llama-3.1等各种数据集和模型家族中证明了评估一致性的提高,同时保持了与GPT-4.1的一致性。

  2. TOOL · CL_183142 ·

    新的AI训练方法使用评分标准作为开放式生成任务的特权信息

    研究人员开发了一种名为On-policy self-distillation (OPSD)的新方法,该方法利用评分标准作为开放式文本生成的特权信息(PI)。该方法通过使用评分标准来指导偏好,从而增强了模型的训练信号,这比使用评分标准作为标量奖励的传统强化学习方法更有效。当应用于Qwen和Llama等模型家族时,该技术在HealthBench和ResearchQA等基准测试中表现出优越的性能,优于参考完成蒸馏和评分标准作为奖励的强化学习。

  3. TOOL · CL_180464 ·

    新的深度研究预训练框架增强了AI代理的训练

    研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理…

  4. RESEARCH · CL_141162 ·

    新基准评估LLM在论文引用问答上的表现

    研究人员推出了ResearchQA,一个旨在评估大型语言模型在基于科学论文回答问题方面的能力的新基准,同时确保答案有可验证的引用支持。该基准包含跨越不同领域和问题类型的6000多个问答对,特别奖励当论文不支持答案时的基于引用的拒绝。对八个领先模型的评估表明,基于引用的指标比基于LLM的评分标准更能有效地区分模型性能,开放权重模型在引用准确性方面表现具有竞争力,并且与闭源模型相比延迟显著降低。