PulseAugur
实时 07:58:20
实体 Pythia-410M

Pythia-410M

PulseAugur coverage of Pythia-410M — every cluster mentioning Pythia-410M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_229075 ·

    研究发现:大型语言模型中的Token表征流是非线性的

    研究人员分析了神经网络中Token表征的流动,发现这种流动是非线性的,并且不遵循自身的密度。他们使用Pythia-160M和Pythia-410M上的离散Langevin模型,证明了二次漂移比线性映射更能准确地表示层转换。研究还揭示了流动的旋转分量很重要,它影响了诸如范数和浓度等Token属性在网络层之间的排名变化。

  2. TOOL · CL_210536 ·

    FlashAttention-V 助力向量架构上的 Transformer 推理

    研究人员开发了 FlashAttention-V,这是 FlashAttention 为可扩展向量架构量身定制的优化版本。该新方法旨在提高 Transformer 模型(特别是小型语言模型 SLM)在新兴向量硬件上的效率。FlashAttention-V 通过融合操作、利用注意力头之间的并行性以及增强内存局部性,实现了显著的加速,在特定硬件配置上,预填充速度提升高达 42 倍,解码速度提升高达 11 倍。

  3. TOOL · CL_187210 ·

    新的点燃指数指标衡量语言模型中的全局工作空间动态

    研究人员引入了点燃指数(I),这是一个旨在量化语言模型中全局工作空间动态的新指标。该标量指标通过分析输入信号强度响应的每层准确性转换,来操作化全局工作空间理论(GWT)的预测。在各种Transformer模型和SSM中,点燃指数在区分真正的语言结构和虚假的探测能力方面表现出9.6倍的选择性。研究结果表明,前馈Transformer的点燃指数通常高于SSM,而像Huginn-3.5B这样的循环架构沿其迭代轴与沿其深度轴相比,表现出不同的点燃模式。

  4. RESEARCH · CL_143684 ·

    新框架支持生成模型水印的用户归属和载荷提取

    研究人员开发了一个新的信息论框架用于生成模型的水印技术,其功能超越了仅检测机器生成文本。该框架支持用户归属、载荷提取以及编辑文本片段的定位。该研究为多用户归属建立了一个严格的熵率定律,表明将文本归属给 N 个用户之一大约需要 log(N)/h 个 token,其中 h 是熵率。对 GPT-2、Pythia-410M 和 Qwen2.5 的实验验证了理论预测。

  5. RESEARCH · CL_41829 ·

    研究发现自训练重构语言模型

    一篇新的研究论文挑战了对语言模型自训练的普遍理解,认为它重构而非扁平化语言。研究发现,虽然话语标记等表面语言特征有所增加,但问句和被动语态等深层句法结构却有所下降。这种“结构深度假说”认为,语言特征的衰减率主要由其结构复杂性决定,而不仅仅是模型输出中的频率。