研究人员探索了使用强化学习进行零样本文本到SPARQL生成,这是知识图谱问答的关键任务。他们将Group-Relative Policy Optimization (GRPO)应用于Qwen3-1.7B模型,利用执行反馈和答案级奖励进行训练,无需金标准查询标注。研究发现,基于结果的奖励显著提高了性能,优于零样本基线,表明在缺乏完全监督的情况下,强化学习是一种可行的策略。 AI
影响 展示了一种无需完全监督即可进行知识图谱问答的可行强化学习方法。
排序理由 学术论文,详细介绍了使用强化学习进行文本到SPARQL生成的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →