PulseAugur
中
实时 06:54:03
实体 WikiText-2

WikiText-2

PulseAugur coverage of WikiText-2 — every cluster mentioning WikiText-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
33
90 天内 33
发布 · 30天
0
90 天内 0
论文 · 30天
32
90 天内 32
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 35 条
  1. RESEARCH · CL_280363 ·

    新方法有望通过稀疏注意力和权重近似加速大语言模型解码

    两篇新研究论文提出了加速大语言模型(LLMs)解码过程的方法。第一篇论文介绍了稀疏非对称分组查询注意力(SAGA),它减少了键头的数量,同时保留了更多的价值头以提高效率,实现了2倍以上的加速,且质量损失极小。第二篇论文SpAx通过结合激活稀疏性和权重近似来解决在内存有限的硬件上部署LLMs的挑战,当权重被卸载到CPU内存或闪存时,可以显著加速。

  2. TOOL · CL_277263 ·

    新的QK-Wanda方法通过耦合查询和键来改进LLM剪枝

    研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。

  3. TOOL · CL_277196 ·

    新的“注意力流形”可对大型语言模型的输出进行可控调节

    研究人员开发了一种名为“注意力流形”的新技术,用于引导和修改大型语言模型的行为。这些流形以学习到的B样条曲面的形式实现,根据查询-键交互来调节值向量,比标准的注意力机制提供了更细致的控制。当应用于LLaMA模型时,该方法提高了在WikiText-2上的困惑度,并显著改变了大多数多样化提示的输出,纠正了事实错误,提高了精度,并增加了特异性。学习到的曲面也是可编辑的,允许直接引导模型并创建“注意力墙”来阻止特定的值维度,这可能对AI安全产生影响。

  4. TOOL · CL_273225 ·

    新的ShamAN-Q方法将大模型权重削减至亚1比特

    研究人员开发了ShamAN-Q,一种新颖的亚1比特大模型训练后量化方法。该技术通过整合源自Shampoo优化器的密集曲率度量来增强NanoQuant,Shampoo优化器使用经验Fisher信息矩阵。ShamAN-Q旨在通过优化权重重建和跨层重新分配比特来提高模型效率和性能,并在Qwen3-Base模型上显示出困惑度的大幅降低。

  5. RESEARCH · CL_273452 ·

    新方法学习函数子空间以实现高效神经网络压缩

    研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩大型神经网络,特别是Transformer和LLM。与使用局部标准的先前技术不同,LSP针对全局目标(例如与原始模型输出分布的KL散度)进行端到端子空间优化。这种方法在更高的压缩率下能更好地保留性能。与现有基线相比,LSP在LLaMA-2 7B和ViT-B/16等模型上表现出更优越的结果,显著降低了困惑度并提高了准确性,同时还实现了更快的解码和更少的内存使用。

  6. TOOL · CL_286010 ·

    新的LSP方法通过端到端学习子空间来增强神经网络压缩

    研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩神经网络,特别是Transformer。与之前使用局部标准的旧技术不同,LSP通过联合优化正交投影仪以实现全局目标,来端到端地学习要丢弃的子空间。这种方法旨在防止深层网络中的误差累积,并在各种LLM和视觉Transformer上展现出优越的性能,尤其是在更高的压缩率下。该方法还提高了注意力机制的解码速度和内存使用效率。

  7. RESEARCH · CL_254436 ·

    新研究为LLM提供先进的低秩压缩方案 · 追踪3个来源

    三篇新研究论文介绍了使用低秩分解压缩大型语言模型(LLM)的先进技术。第一篇论文《Per-Matrix Optimality Is Not Enough》提出了一种三级优化策略,通过考虑Transformer块和整个模型,而不仅仅是单个矩阵,显著提高了困惑度。第二篇论文《UniRank》提出了一种统一的秩分配方法,根据局部能量和全局功能重要性对组件进行评分,实现了困惑度和准确度的显著提升。第三篇论文《MoARa》通过采用模块感知秩分配…

  8. TOOL · CL_247628 ·

    Qwen3-8B模型已扩展用于超低比特语言处理

    研究人员已成功将训练后三元化技术扩展到Qwen3-8B语言模型,旨在降低存储和内存需求。该研究进行了全面的评估,包括复现门、能力分析和直接打包执行。在三个语料库上,该8B模型达到了1.361倍的困惑度比,并在零样本任务上保持了64.6%的准确率,证明了其对激进离散化的鲁棒性。

  9. TOOL · CL_245266 ·

    新的黎曼语言模型使困惑度提高2倍

    研究人员推出了一种新颖的参数高效语言建模方法——黎曼语言模型(RiLM),该方法无需输出矩阵。该方法利用测地线解码,其中上下文在黎曼流形上作为轨迹展开,下一个词的概率由当前状态与词汇嵌入之间的测地线距离决定。在WikiText-2上的实验中,双曲变体(HypRiLM)的困惑度达到54.2,性能大约是绑定循环基线的两倍,并且显著优于平面流形实现。

  10. TOOL · CL_244779 ·

    加州大学伯克利分校研究人员为Transformer开发基于Bandit的剪枝方法

    加州大学伯克利分校的研究人员开发了一种新颖的方法来剪枝大型Transformer模型,包括用于视觉和语言任务的模型。该技术被构建为一个损伤感知的多臂老虎机(multi-armed bandit)问题,旨在识别并移除Transformer内的完整功能单元,同时将性能下降降至最低。该方法通过掩码注意力头(attention heads)和MLP通道组来衡量它们对模型损失的影响,然后使用Thompson sampling等采样策略依次选择要…

  11. TOOL · CL_239259 ·

    ACE框架通过跳过冗余专家计算来优化MoE大型语言模型

    研究人员开发了ACE,一个新颖的框架,旨在通过自适应地跳过冗余专家计算来优化混合专家(MoE)大型语言模型。这种无需训练的方法利用全局谱代理和路由器条件细化来估计专家贡献,而不依赖于路由器置信度或校准数据。ACE在各种基准测试和MoE模型上始终优于现有方法,显著降低了困惑度并提高了下游准确性,尤其是在激进的专家跳过场景下。

  12. TOOL · CL_236321 ·

    PCST 方法将 LLaMA-7B 模型压缩至 2.05 GiB,但质量有所下降

    研究人员开发了 PCST(Product Code Structured Transform)方法,能够在无需重新训练的情况下将 LLaMA-7B 模型压缩至 2.05 GiB。尽管 PCST 实现了比 Q3_K_M 模型更小的文件大小,但在质量和运行时性能方面表现不佳。该项目探索了超过 60 种压缩技术,发现降低权重的均方误差(MSE)并未持续提高最终的 token 准确率。这项工作表明,未来的压缩努力应侧重于网络范围的表示和误差整…

  13. TOOL · CL_231345 ·

    新的 OCGQuant 方法增强了 Llama 3 和 Qwen 3 的 NVFP4 量化

    研究人员开发了 OCGQuant,一种新的训练后量化方法,旨在通过解决激活离群值问题来提高 NVFP4(一种高效的低比特推理微缩放格式)的准确性。OCGQuant 通过自适应地将离群值通道与低幅度伴随通道配对,以增强 NVFP4 激活块的组成。在 Llama 3 和 Qwen 3 模型上的实验表明,与评估过的其他训练后量化方法相比,OCGQuant 在 WikiText-2 困惑度和下游准确性方面取得了更优异的结果,同时保持了具有竞争…

  14. TOOL · CL_229421 ·

    新的ADMM-Q算法增强了LLM量化,降低了困惑度

    研究人员开发了ADMM-Q,这是一种旨在改进大型语言模型训练后量化的新算法。该方法利用交替方向乘子法的组合变体来解决逐层量化问题,旨在降低存储和计算需求,同时不显著影响模型效用。ADMM-Q被设计为现有量化器的模块化替代品,并且可以与其他技术集成。在Qwen3-8B模型上的初步测试显示,在各种量化设置下困惑度均有显著降低。

  15. TOOL · CL_229113 ·

    新型记忆层在无注意力机制下提升AI回忆准确性

    研究人员为无注意力机制的循环序列模型开发了一种名为“笔记本”的新型记忆层,以解决其回忆过去信息方面的弱点。该笔记本由一个具有学习门控的全息关联存储器组成,显著提高了单次回忆的准确性,即使在远超训练数据长度的情况下也是如此。该系统展示了选择性遗忘和每令牌归因等能力,为回忆的信息提供了精确的出处。当应用于真实文本时,该笔记本提高了重复罕见词的预测能力,并在没有记忆污染的情况下保持了在扩展长度下的性能。

  16. RESEARCH · CL_215748 ·

    新的IPZO架构增强了IMC加速器上的SNN微调

    研究人员开发了一种事件触发隐式扰动(IPZO)架构,以提高在内存计算(IMC)加速器上微调脉冲神经网络(SNN)的效率。这种新方法消除了冗余的读-改-写操作,并通过仅为激活的权重生成扰动来减小随机数生成器的硬件占用空间。IPZO架构,特别是采用PGU-XOR方案时,在能耗和面积开销方面与之前的扰动方法相比显著降低,同时实现了与基于软件的方法相当的准确性。

  17. TOOL · CL_206313 ·

    Transformer LM 头压缩:有害瓶颈还是几何压缩?

    研究人员调查了 Transformer 中的语言模型头是否会造成有害的梯度瓶颈。他们使用 WikiText-2 模型进行仅后向干预的实验,发现减小输入 Transformer 的梯度的秩实际上会增加验证损失。相反,具有同等减小秩的因子化前向头会导致损失更大幅度地增加。这些发现表明,虽然发生了强烈的几何压缩,但这可能并非一个有害的优化瓶颈。

  18. TOOL · CL_191133 ·

    新的分块SVD方法直接从权重中提取网络机制

    研究人员开发了一种名为列分块SVD的新方法,可以直接从神经网络中的线性位提取可用的权重机制。该方法识别网络权重本身的概念,而不是依赖外部代理词典。该方法在Gemma-2-2B上使用WikiText-2进行了评估,在所有测试的线性映射中均获得满分182/182,其中特定的映射在残差写入方面显示出完整的A/B/C评分。

  19. RESEARCH · CL_183287 ·

    新研究探索大语言模型效率和推理能力的提升

    多篇研究论文探讨了提高大语言模型(LLMs)效率和可靠性的方法。Hugging Face 的 LFM2.5-DSpark 通过使用推测性解码技术,展示了高达 3.2 倍的推理速度提升。OpWeave 和 LayerRoute 分别提出了用于跨异构硬件优化大语言模型服务和实现自适应层跳过的框架。其他研究则关注大语言模型的推理和校准,其中 ZebraArena 为工具增强型大语言模型提供了诊断环境,而 Efficiency Halluci…

  20. TOOL · CL_174100 ·

    新的SCSE方法改进了用于文本任务的循环Transformer

    研究人员引入了以源为中心的态演化(SCSE),这是一种旨在增强循环Transformer的新颖方法。SCSE通过确保精确的锚点不变性,解决了在不同循环深度下保持一致的隐藏状态的挑战。这种方法允许输入条件化,同时保留参考点,从而在文本补全和迁移学习等任务上提高了性能。