研究人员开发了SLAI T-Rex框架,用于在Ascend SuperPOD基础设施上优化万亿参数MoE模型的全参数后训练。该系统实现了34.22%的模型FLOPs利用率(MFU),比基线方法提高了2.93倍,同时保持了训练稳定性。该框架随后用于使用10K样本数据集创建专门的运筹学(OR)模型,所得的DeepSeek-V4-Flash模型在OR任务上优于GPT-5.4-Mini和基础DeepSeek-V4-Flash。 AI
影响 展示了在非GPU硬件上进行高效万亿参数模型训练和专业化的途径,可能实现更复杂的推理能力。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一种用于在特定硬件上训练大型语言模型的新框架和优化技术。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →