PulseAugur
实时 17:53:33
English(EN) Trace-Based On-Policy Distillation for Masked Diffusion Language Models

新研究分析 dLLM 感应并引入新颖的训练方法

两篇新研究论文探讨了扩散大型语言模型(dLLM)的机制和训练。第一篇论文介绍了基于轨迹的策略内蒸馏(TOPD)框架,该框架通过监督 dLLM 自身的去噪轨迹来提高其推理能力,在数学基准测试中取得了具有竞争力的准确率,同时显著降低了计算量。第二篇论文对 dLLM 中的上下文内学习进行了机制分析,揭示了一个利用过去和未来上下文的双向感应电路,在可用双向上下文时优于自回归模型。 AI

影响 这些论文推动了对扩散语言模型的理解和训练,有望为推理等复杂任务带来更强大、更高效的模型。

排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了扩散语言模型的新方法和分析。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新研究分析 dLLM 感应并引入新颖的训练方法

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu ·

    面向掩码扩散语言模型的基于轨迹的在线策略蒸馏

    arXiv:2607.16872v1 Announce Type: cross Abstract: Diffusion large language models (dLLMs) are a promising alternative to autoregressive generation. However, reasoning-oriented post-training for dLLMs remains challenging. Supervised fine-tuning (SFT) for dLLMs requires dense but o…

  2. arXiv cs.AI TIER_1 English(EN) · Andy Catruna, Emilian Radoi ·

    双向归纳:掩码扩散语言模型中上下文学习的机制分析

    arXiv:2607.15893v1 Announce Type: cross Abstract: While the internal mechanisms of autoregressive (AR) transformers have been studied extensively, much less is known about diffusion language models (DLMs), an emerging alternative that generates text by iterative denoising. In thi…