研究人员推出了一种新方法,称为轨迹增强策略优化(TAPO),用于大型语言模型的自蒸馏。与隐式对齐分布的传统方法不同,TAPO显式地构建了纠正性轨迹。这些轨迹保留了错误推理直到失败点,然后纳入自然语言诊断和纠正后的推理。在AIME 2024、AIME 2025和HMMT 2025上的实验表明,与GRPO相比,TAPO提高了初始推理和纠错的有效性。 AI
影响 通过在训练过程中提供更有针对性的纠错来增强LLM的推理能力。
排序理由 该集群描述了一篇关于通过自蒸馏改进大型语言模型推理的新颖方法的新研究论文。
- AIME 2024
- AIME 2025
- Grpo
- HMMT 2025
- Tapolca
- Trajectory-Augmented Policy Optimization
- Kullback–Leibler divergence
- Self-distillation
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →