PulseAugur
实时 04:54:16
实体 Wanda

Wanda

PulseAugur coverage of Wanda — every cluster mentioning Wanda across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_139240 ·

    新的Super-Tuning方法提高了LLM微调效率

    研究人员开发了一种名为Super-Tuning的新方法,旨在提高大型语言模型(LLM)微调的效率。该技术重用了模型剪枝中的显著性信号来识别需要调整的参数。提出的Super方法使用校准过程中的激活加权幅度得分来选择一个小的可训练支持,而Supra变体将其与LoRA适配器结合。在Llama-3.2-1B和Meta-Llama-3-8B模型上的实验表明,Super/Supra变体在测试的适配器配置中达到了高精度,表明受剪枝启发的排序可以有效…

  2. RESEARCH · CL_133157 ·

    PALS方法通过调整层级稀疏性来改进LLM剪枝

    研究人员开发了PALS(Percentile-Aware Layerwise Sparsity),一种用于剪枝大型语言模型的新颖方法。与现有的应用统一稀疏性的一次性方法不同,PALS根据激活幅度动态调整每层的稀疏性比例。这种方法在LLaMA-2-7B的困惑度方面显示出显著的改进,取得了比统一剪枝方法更好的结果。然而,其益处依赖于架构,LLaMA-3-8B仅显示边际收益,而Mistral-7B则没有显示任何收益。

  3. TOOL · CL_100162 ·

    新的剪枝方法可保留LLM推理性能

    研究人员开发了一种名为因果归因剪枝(CAP)的无训练新方法,可在不损害其推理能力的情况下减小大型语言模型的规模。CAP通过衡量注意力头对推理任务的因果影响来识别和剪枝不那么关键的注意力头。与Wanda等现有方法相比,该方法在ARC-Challenge等基准测试上表现出显著的改进,并在中等稀疏度水平下对Llama-3和Mistral-7B-Instruct等模型显示出潜力。

  4. TOOL · CL_22110 ·

    新研究量化了压缩Transformer中的误差传播

    研究人员开发了一种方法,以更好地理解和管理压缩Transformer模型中的误差传播。通过测量每层输出与输入误差之比(rho),他们发现误差会可预测地累积,解释了为什么压缩早期层会更具破坏性。该分析还揭示了层内组件敏感性存在显著差异,表明重要性分数在不同模型架构之间转移不佳。该研究提出了一种无需训练的方法,利用这些压缩配置文件来指导在层内何处进行压缩以及完全移除哪些层,从而在不显著损失性能的情况下提高效率。