LLaDA-8B-Base
PulseAugur coverage of LLaDA-8B-Base — every cluster mentioning LLaDA-8B-Base across labs, papers, and developer communities, ranked by signal.
-
新研究应对大语言模型推理、效率和蒸馏挑战 · 跟踪 10 个来源
新研究探索了提高大语言模型(LLMs)推理能力和效率的方法。一篇论文引入了“Trace as State”,通过将推理痕迹置于上下文块之前来增强长上下文推理,在各种模型和数据集上显示出显著的性能提升。另一项研究提出了“SALA”,用于上下文学习中的语义感知逻辑对齐,改进了复杂推理任务的演示选择。此外,关于“HEAL”的研究旨在通过解决当前蒸馏技术的局限性,从 LLMs 中将推理蒸馏到更小的模型中,其灵感来源于教育理论。
-
新研究解决了掩码扩散语言模型的评估和架构问题
两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。
-
新研究提升扩散语言模型的效率和语义 · 跟踪3个来源
研究人员开发了新方法来改进扩散语言模型,解决了其效率和语义理解方面的局限性。其中一种方法 JUMP 通过实现对微调的离散扩散语言模型的单次传递分析来增强成员推理攻击,显著提高了准确性,优于先前的方法。另一项开发 CoDD 通过引入一个轻量级的概率推理层来解决“因子分解障碍”,该层允许在不增加过多参数的情况下实现更具表现力的联合分布,从而实现更快、更连贯的生成。此外,REGLUE 将视觉基础模型的全局和局部语义集成到潜在扩散模型中,提高…