PulseAugur
实时 07:44:31
实体 Yaroslav Aksenov

Yaroslav Aksenov

PulseAugur coverage of Yaroslav Aksenov — every cluster mentioning Yaroslav Aksenov across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_229221 ·

    新的LIMe扩展提升了Transformer的表示能力

    研究人员推出了一种名为层集成记忆(LIMe)的新型Transformer模型扩展,旨在增强其表示能力。与仅依赖前一层隐藏状态的传统Transformer不同,LIMe通过学习到的路由权重整合了早期层的表示。这种方法旨在缓解表示崩溃,并提高在语言建模和合成推理等各种任务上的性能。该方法在每FLOP的困惑度(perplexity per FLOP)和更好的token可分性方面均有所提升,学习到的权重表明特征得到了系统性重用。

  2. TOOL · CL_229183 ·

    新的软潜在思维方法在连续空间中改进了大型语言模型的推理能力

    研究人员推出了一种名为软潜在思维(Soft Latent Thinking)的新颖方法,旨在增强大型语言模型的推理能力。该方法用一个更高效的投影仪取代了传统的用于解码的计算头,使得推理能够在连续的嵌入空间中进行,而不是离散的 token。在 DeepSeek-Qwen-1.5B 和 LLaMA-3.2-3B 等模型上进行的实验表明,在 pass@k 指标上,尤其是在较高值时,性能有了显著提高,同时还降低了思维链(chain-of-th…

  3. TOOL · CL_229223 ·

    新的KronSAE设计增强了稀疏自编码器的效率和可解释性

    研究人员推出了一种新颖的稀疏自编码器(SAE)设计KronSAE,提高了其效率和可解释性。与将潜在字典视为扁平坐标的传统SAE不同,KronSAE将潜在空间分解为多个头,并使用低维预潜在变量的两两组合。这种方法施加了组合式共激活先验,增强了对相关特征结构的捕获能力,并降低了计算成本。KronSAE在EV-FLOPs等基准测试中表现出竞争力,并提供了更清晰的潜在特征可解释性。