LLM 后训练技术近期取得了进展,重点关注参数高效微调、偏好优化和蒸馏。DIAL-OPD 等新方法在蒸馏中展示了从更少 token 中学习能力的提高,而 LSC-DPO 则为直接偏好优化提供了一种学习信号控制的方法。此外,对 Group Policy Optimization (GRPO) 的研究已识别出故障模式并提出了解决方案,GRPO 也被应用于生产 OCR 任务。 AI
影响 这些进展提供了提高 LLM 训练效率和性能的实用方法,有可能降低计算成本并增强模型能力。
排序理由 该集群包含多篇详细介绍 LLM 后训练技术新方法和分析的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AlpacaEval 2
- Bartolomeo Schedoni
- DIAL-OPD
- Direct Preference Optimization
- Falcon OCR Arabic
- Group Policy Optimization
- Grpo
- GRPODropout
- KL regularization
- LightOnOCR-3
- LoRA+
- LSC-DPO
- Olmo
- Qwen
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →