一位用户开发了一种受 Nanbeige 4.5 启发的“三循环”模型架构,并将其应用于 Qwen3.5-9B。该实验模型使用 Qwen3.8-27B 的蒸馏 logits 进行训练,与基础 Qwen3.5-9B 相比,在数学、长上下文任务和指令遵循方面表现出显著的改进。然而,由于资源限制,训练被缩短,导致性能出现平台期,推理和翻译能力略有下降。用户认为,通过完整的训练计划和适当的学习率衰减,仍有可能取得进一步的进展。 AI
影响 展示了架构创新改进现有模型的潜力,但仍需进一步验证。
排序理由 用户开发的模型架构应用于现有基础模型,并进行了性能评估。[lever_c_demoted from research: ic=1 ai=1.0]
- ChatGPT
- Claude
- Gemini
- Lordnyx/qwen3.5-9b-triple-loop-fase1
- Modal
- Nanbeige
- Qwen3-0.6B
- Qwen3.5:9b
- Qwen3.8-27B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →