研究人员开发了一种名为HeuristicEdu的新方法,用于训练大型语言模型(LLM)在教育环境中充当苏格拉底式指导者,而不是简单地提供直接答案。这个两阶段的流程使用了监督学习和一种名为Group Relative Policy Optimization (GRPO)的强化学习技术,在一个儿童科学对话的数据集上进行训练。该系统使用诸如脚手架有效性(Scaffolding Effectiveness)和对话深度(Conversation Depth)等指标进行评估,与未对齐的基线模型相比,在指导学生和减少概念过早泄露方面显示出显著的改进。 AI
影响 这项研究可能带来更有效的AI导师,通过引导式探究而非死记硬背来促进更深入的学习。
排序理由 关于LLM新对齐方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →