Marchenko--Pastur
PulseAugur coverage of Marchenko--Pastur — every cluster mentioning Marchenko--Pastur across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Transformer注意力中的谱异常值揭示了主导的学习结构
研究人员应用Marchenko-Pastur随机矩阵理论分析了预训练Transformer的注意力权重,识别出代表主导学习结构的谱异常值。通过将Mistral-7B模型中识别出的这些异常值归零,模型在HellaSwag和MMLU等基准测试上的性能显著下降,接近随机猜测水平。对多个Transformer的分析揭示了重复出现的模式,例如Q投影包含最多的异常值,以及特定的残差流维度在各层中形成带状异常值,这表明可能在参数高效微调和结构化剪枝…
-
新的谱正则化方法提高了线性回归风险性能
研究人员开发了一种名为负移梯度下降的新方法,用于过参数化线性回归。该技术旨在通过允许混合符号谱正则化来克服传统负脊正则化的局限性。该方法具有平滑的滤波器,可以控制较低的特征值,同时收缩或暴露较高的特征值,从而在特定条件下提高风险性能。
-
研究发现:LLM采样变化并不能揭示模型无知
一篇新研究论文发布在arXiv上,探讨了大型语言模型(LLMs)中随机采样的局限性。该研究题为“随机采样在认知上是肤浅的:LLM中温度变化与模型多样性之间的维度鸿沟”,表明单一代言模型多次运行产生的输出变化并不能有效地揭示模型不知道的内容。研究人员使用MMLU、HellaSwag和GSM8K等基准测试,将单一代言模型运行100次与24个LLM模型的一次运行集合进行了比较。他们的发现表明,虽然自我一致性提供了每个问题的模型不确定性,但它…
-
新的去底主成分回归方法提高了预测准确性
研究人员推出了一种名为去底主成分回归(dPCR)的新颖方法,旨在提高高维数据的预测准确性。与传统的主成分回归(PCR)不同,后者可能受到经验特征值系统性膨胀的阻碍,dPCR 通过估计并从保留的特征值中减去一个“底”来解决这个问题。当聚合协方差尾部产生显著的噪声底时,该技术特别有效,与标准的 PCR 方法相比,可以做出更精确的预测。
-
新的“Muse”优化器探索LLM的表示几何
研究人员推出了一系列新颖的优化器“Muse”,专为大型语言模型设计,用于探索参数表示的几何特性。与标准的Muon风格优化器不同,Muse的更新受到正交化前每个参数块表示的影响。在LLaMA2-130M和LLaMA2-600M上的实验表明,平衡的非原生表示可以达到与原生表示相当的性能,而减小较短的维度会削弱缩放和单通道支持。
-
新方法改进 RBM 对分布外数据的拒绝能力
研究人员开发了一种新方法,以提高受限玻尔兹曼机 (RBM) 在处理分布外 (OOD) 输入时的性能。通过训练 RBM 使用分配给拒绝标签的辅助随机二值图像,模型的交互矩阵会发生有效的秩崩溃。此过程将谱权重集中到更少的占优特征方向上,从而使 RBM 能够拒绝结构化的分布外图像数据集,同时保持在 MNIST 等数据集上的准确性。
-
新判据预测滞后谱嵌入的有效性
研究人员开发了一种新的判据,用于确定多元时间序列的无训练滞后谱嵌入的适用性。该判据基于平稳性和时间耦合性,可预测称为 D(tau) 的描述符是否能有效运行。该方法包括一个两部分的预测试:增强的 Dickey-Fuller 平稳性检查和功率基线饱和度检查。研究在各种数据集上验证了该判据,结果显示在符合判据的数据集上表现具有竞争力,而在不符合的数据集上则可预测地失败。