PulseAugur
实时 11:58:11
实体 Activation Outliers

Activation Outliers

PulseAugur coverage of Activation Outliers — every cluster mentioning Activation Outliers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_200804 ·

    原生低比特大型语言模型架构优于训练后压缩

    文章认为,大型语言模型的训练后压缩技术存在根本性缺陷。文章解释了这些方法,即在训练后通过量化权重来减小模型大小,之所以失败,是因为它们无法处理对模型智能至关重要的动态激活离群值。这些离群值,其规模超过10^5,对于语法规则和零样本推理至关重要。激进地量化它们会破坏模型的性能,而保留它们则会扭曲量化尺度。作者提倡采用原生、软硬件协同设计的低比特架构,例如1.58位三元网络(BitNet b1.58)和1.25位架构(Sherry),作为…

  2. RESEARCH · CL_62311 ·

    新的SAE方法增强了可解释性和稳定性

    研究人员在稀疏自编码器(SAE)方面取得了几项进展,以提高其可解释性和稳定性。Concept-SAE 提供了一个可控的接口,用于探测 SAE 中用户定义的概念,增强了其诊断能力。子空间感知稀疏自编码器(SASA)通过用学习到的解码器子空间替换单向量解码器来解决特征分裂问题,从而产生更连贯的特征并提高效率。此外,还提出了对齐训练和均值中心化技术来解决特征死亡和不稳定性等问题,使 SAE 成为理解深度神经网络更可靠的工具。