实体
LLaDA2.0-mini
LLaDA2.0-mini
PulseAugur coverage of LLaDA2.0-mini — every cluster mentioning LLaDA2.0-mini across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Masked diffusion LLMs use EoS tokens for hidden reasoning
研究人员发现,掩码扩散大型语言模型(LLMs)可以利用序列结束(EoS)标记进行隐藏推理,从而提高其在复杂任务上的性能。通过将答案填充到超出正确长度的EoS标记,这些模型似乎利用这些标记的表示作为额外的计算能力。在加法、实体跟踪和数独等任务上使用LLaDA1.5和Dream-v0等模型进行的实验证实,添加EoS标记可以提高准确性。进一步的因果干预,即将EoS标记的隐藏状态转移,增加了反事实答案的可能性,表明这些标记具有潜在的推理能力。
-
LLM 推理和推理技术随着新研究和硬件的进步而发展
研究人员正在探索新的方法来提高大型语言模型 (LLM) 的效率和推理能力。Google Research 正在开发训练 LLM 以贝叶斯方式进行推理的技术,从而提高它们更新概率估计和泛化到新任务的能力。同时,推理优化方面的进展包括“投机级联”,它将更小、更快的模型与更大的模型结合起来,以及“上下文回收”来管理长对话范围。此外,正在开发“级联多粒度剪枝”和“SharQ”等方法来压缩 LLM 以进行设备上推理,从而在保持准确性的同时降低延…