Auguste Hadamard
PulseAugur coverage of Auguste Hadamard — every cluster mentioning Auguste Hadamard across labs, papers, and developer communities, ranked by signal.
-
统一 INT4 量化在真实梯度张量上优于 NVFP4
一项比较梯度张量量化方案的研究发现,在真实世界训练数据上,统一 INT4 量化方案优于 NVIDIA 的 NVFP4 量化方案。研究表明,在量化前通常应用的随机 Hadamard 旋转能有效处理异常值,使得类似浮点数的间隔所提供的动态范围变得不那么关键。因此,一种更简单、均匀间隔的 INT4 量化方案被证明在梯度训练中更有效。
-
RoPE 对齐的旋转未能提高 4 位量化精度
一篇新的研究论文探讨了 RoPE 对齐的 Q/K 旋转在语言模型的动态 4 位量化中的有效性。研究发现,虽然成对旋转可以与 RoPE 交换,但在测试的动态 W4A4KV4 设置中,它们并未提高精度。用这些配置替换全头 Hadamard 变换实际上增加了多个检查点和上下文长度的困惑度。
-
新研究预测随机重参数化对神经网络训练效率的影响
一篇新研究论文介绍了随机映射网络(RaMaN),这是一种旨在预测随机低维重参数化何时能有效训练神经网络的方法。该论文提出了一种面向方向的二次主公式,用于根据曲率谱和位移剖面来预测训练转换。RaMaN 利用结构化的 Hadamard 或高斯映射来实例化预测的潜在维度,从而减少内存需求并实现各种模型的有效训练。
-
新技术改进Transformer KV缓存压缩
研究人员开发了Codec-Gauge,这是一种训练后层,旨在改进长上下文Transformer模型中键值(KV)缓存的压缩。该方法学习正交通道变换,以优化KV缓存的坐标几何以适应压缩后端。通过将KV能量集中在低频布局中,Codec-Gauge显著降低了KL散度,并提高了各种量化方法的质量保持能力,其性能优于PCA和DCT等标准技术。
-
新的KReTTaH框架通过张量训练提供无数据插补
引入了一个名为KReTTaH的新框架,用于多路数据插补,利用张量训练和Hadamard过参数化的核回归。该方法被设计为无训练数据、可解释和非参数的。KReTTaH将插补问题重新表述为再生核希尔伯特空间内的回归问题,将张量回归系数约束在固定秩张量训练流形上,并采用Hadamard过参数化以提高效率。在功能性磁共振成像数据和动态图恢复上的数值测试表明,KReTTaH在准确性方面优于当前最先进的张量、贝叶斯和神经网络方法。