研究人员开发了新的方法来提高大型语言模型(LLM)的推理能力,特别是在长上下文和多语言任务方面。一种方法 OGLS-SD,在策略内自蒸馏过程中使用结果引导的logit引导来校准教师模型的响应,从而实现更稳定有效的推理。另一种方法 dGRPO,将策略内优化与蒸馏相结合,以增强长上下文推理,并引入了一个名为 LongBlocks 的新数据集。此外,COPSD 通过自蒸馏将高资源语言的推理行为转移到低资源语言,专门针对低资源语言,在多语言数学推理方面取得了显著改进。 AI
影响 这些新技术为 LLM 推理提供了更高的稳定性和有效性,尤其是在具有挑战性的长上下文和多语言场景中,有可能拓宽其应用范围。
排序理由 多篇 arXiv 论文详细介绍了改进 LLM 推理的新方法。
- COPSD
- Crosslingual On-Policy Self-Distillation
- Group Relative Policy Optimization
- Large language models
- dGRPO
- LongBlocks
- OGLS-SD
- GRPO
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →