研究人员推出了一种新颖的 STRETCH 框架,旨在克服大型语言模型 (LLM) 在自改进训练过程中能力停滞的问题。STRETCH 借鉴了认知支架理论,采用动态的“Stretch Zone”(延伸区)机制,根据 LLM 不断变化的熟练程度,动态调整提供给它的挑战难度。该框架允许一个单一参数空间同时容纳生成自适应挑战的“Scaffolder”(支架)和通过强化学习改进其问题解决能力的“Learner”(学习者),从而实现更稳定的训练和渐进式的推理增长。 AI
影响 该框架可能带来更强大且持续改进的 LLM,从而加速复杂推理任务的进展。
排序理由 该集群包含一篇详细介绍 LLM 演进新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- cognitive scaffolding theory
- negotiation
- operations research
- reinforcement learning
- Scaffolder
- Self-Taught Reasoning Evolution via Targeted CHallenge
- STRETCH
- Stretch Zone
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →