两篇新研究论文探讨了扩散大型语言模型(dLLM)的机制和训练。第一篇论文介绍了基于轨迹的策略内蒸馏(TOPD)框架,该框架通过监督 dLLM 自身的去噪轨迹来提高其推理能力,在数学基准测试中取得了具有竞争力的准确率,同时显著降低了计算量。第二篇论文对 dLLM 中的上下文内学习进行了机制分析,揭示了一个利用过去和未来上下文的双向感应电路,在可用双向上下文时优于自回归模型。 AI
影响 这些论文推动了对扩散语言模型的理解和训练,有望为推理等复杂任务带来更强大、更高效的模型。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了扩散语言模型的新方法和分析。
- absorbing-mask DLMs
- AR Models
- arXiv
- Diffusion language models
- DLMs
- Hugging Face
- Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models
- transformers
- Diffusion large language models
- dLLMs
- MATH500
- SDAR-4B-Chat
- Trace-Based On-Policy Distillation
- TraDo-4B-Instruct
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →