一位用户正在提供有关其 Yandex/AliceAI-80B-A3B 模型训练后工作的更新。初始训练运行遇到了一个 NaN 问题,导致梯度归零且运行失败,因此需要重启。用户此后已重新开始训练过程,正在监控更健康的损失曲线,并计划在完成后发布 GGUF 版本和 llama.cpp 补丁。之前的更新详细介绍了使用合成数据进行指令微调的过程,以及训练注意力层和共享专家层而冻结基础专家层的策略。 AI
影响 这项工作为开源社区在微调和适应大型语言模型以完成特定任务的努力做出了贡献。
排序理由 用户主导的对现有模型的研究和开发,而非前沿发布。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →