研究人员开发了次梯度驯服无调整 Langevin 算法 (SG-TULA),这是一种用于从复杂分布中采样的创新方法,这些分布是不可微、非凸的,并且具有超线性梯度增长。该算法直接在次梯度上运行,避免了计算密集型的平滑过程,并与现有的基于次梯度的 Langevin 算法相比,在 Wasserstein-2 距离上提供了改进的非渐近收敛界限。SG-TULA 已被证明能够有竞争力地预训练 GPT-2 系列的 LLM,表现与微调的 AdamW 和 Muon 相当,而后者尚未提供类似的理论保证。 AI
影响 这种新算法为 LLM 的预训练提供了理论保证和有竞争力的性能,有可能提高采样效率和模型训练。
排序理由 该集群描述了一篇详细介绍机器学习新算法的学术论文。
在 Hugging Face Daily Papers 阅读 →
- AdamW
- GPT-2
- Langevin Diffusion
- Muon
- SG-TULA
- Subgradient Tamed Unadjusted Langevin Algorithm
- Wasserstein-2 distance
- arXiv
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →