两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。 AI
影响 这些进展旨在提高掩码扩散语言模型的可靠性和性能,可能带来更强大的双向文本生成系统。
排序理由 两篇学术论文介绍了掩码扩散语言模型的新评估协议和模型架构。
- Autoregressive Transformers
- DiffuGPT
- Diffusion language models
- Dream-7B-Base
- GPT-2 Medium
- Hybrid Attention
- LLaDA-8B-Base
- LM1B
- Masked Diffusion Language Models
- MAUVE
- OpenWebText
- PreDiff-LM
- WikiText-103
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →