Yaroslav Aksenov
PulseAugur coverage of Yaroslav Aksenov — every cluster mentioning Yaroslav Aksenov across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的LIMe扩展提升了Transformer的表示能力
研究人员推出了一种名为层集成记忆(LIMe)的新型Transformer模型扩展,旨在增强其表示能力。与仅依赖前一层隐藏状态的传统Transformer不同,LIMe通过学习到的路由权重整合了早期层的表示。这种方法旨在缓解表示崩溃,并提高在语言建模和合成推理等各种任务上的性能。该方法在每FLOP的困惑度(perplexity per FLOP)和更好的token可分性方面均有所提升,学习到的权重表明特征得到了系统性重用。
-
新的软潜在思维方法在连续空间中改进了大型语言模型的推理能力
研究人员推出了一种名为软潜在思维(Soft Latent Thinking)的新颖方法,旨在增强大型语言模型的推理能力。该方法用一个更高效的投影仪取代了传统的用于解码的计算头,使得推理能够在连续的嵌入空间中进行,而不是离散的 token。在 DeepSeek-Qwen-1.5B 和 LLaMA-3.2-3B 等模型上进行的实验表明,在 pass@k 指标上,尤其是在较高值时,性能有了显著提高,同时还降低了思维链(chain-of-th…
-
新的KronSAE设计增强了稀疏自编码器的效率和可解释性
研究人员推出了一种新颖的稀疏自编码器(SAE)设计KronSAE,提高了其效率和可解释性。与将潜在字典视为扁平坐标的传统SAE不同,KronSAE将潜在空间分解为多个头,并使用低维预潜在变量的两两组合。这种方法施加了组合式共激活先验,增强了对相关特征结构的捕获能力,并降低了计算成本。KronSAE在EV-FLOPs等基准测试中表现出竞争力,并提供了更清晰的潜在特征可解释性。