研究人员开发了一种开源预训练方案,显著降低了训练大型语言模型的成本,使其在消费级 GPU 上训练的成本低于 7000 美元。他们训练的 Puro-2B 模型在 RTX 5090 GPU 上训练,其性能与 Qwen2-1.5B 等更大模型相当。该研究还引入了“Puro 成本缩放定律”,估计达到 Qwen2-1.5B 性能的成本低于 5090 美元,并探讨了数据课程如何影响下游性能。 AI
影响 降低了学术界和开源社区在可访问硬件上训练大型语言模型的门槛。
排序理由 该条目描述了一篇研究论文中发布的新开源训练方案和模型。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →