实体
DBLP-QuAD
DBLP-QuAD
PulseAugur coverage of DBLP-QuAD — every cluster mentioning DBLP-QuAD across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
强化学习提升零样本文本到SPARQL生成能力
研究人员探索了使用强化学习进行零样本文本到SPARQL生成,这是知识图谱问答的关键任务。他们将Group-Relative Policy Optimization (GRPO)应用于Qwen3-1.7B模型,利用执行反馈和答案级奖励进行训练,无需金标准查询标注。研究发现,基于结果的奖励显著提高了性能,优于零样本基线,表明在缺乏完全监督的情况下,强化学习是一种可行的策略。
-
强化学习训练小型模型进行文本到SPARQL生成
研究人员探索了使用强化学习来训练小型语言模型进行零样本文本到SPARQL生成,这项任务对于知识图谱问答至关重要。他们将组相对策略优化(GRPO)应用于Qwen3-1.7B模型,利用执行反馈和答案级奖励,而不是要求黄金查询注释。GRPO训练的模型在零样本基线上显示出显著的改进,证明了在没有完全监督的情况下,基于结果的强化学习在此任务上的可行性。