Reglue
PulseAugur coverage of Reglue — every cluster mentioning Reglue across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究增强扩散语言模型的效率和语义 · 跟踪3个来源
研究人员开发了改进扩散语言模型的新方法,解决了其效率和语义理解方面的局限性。一种名为 JUMP 的方法通过对微调的离散扩散语言模型进行单遍分析来增强成员推理攻击,显著提高了准确性。另一项开发 CoDD 通过引入一个轻量级的概率推理层来解决“因子分解障碍”,该层允许在不增加过多参数的情况下实现更具表现力的联合分布,从而实现更快、更连贯的生成。此外,REGLUE 将视觉基础模型的全局和局部语义集成到潜在扩散模型中,提高了图像合成质量和收敛速度。
-
MLP 跳跃连接无法被吸收进无残差模型
研究人员调查了一个单隐藏层 MLP 周围的跳跃连接是否可以被吸收进一个相同宽度的无残差 MLP。他们发现,对于 ReLU^2 和 ReGLU 等某些激活函数,由于次数参数的原因,吸收是不可能的。对于 SwiGLU 和 GeGLU 等门控激活函数,线性化参数也得出了相同的结论。虽然在特定的、非通用的权重条件下,吸收对于无门控的 ReLU 和 GELU 是可能的,但跳跃连接和无残差的 MLP 通常代表不同的函数类别。
-
Hugging Face 推出 REGLU 以实现高效 LLM 遗忘
研究人员开发了一种名为表示引导低秩遗忘(REGLU)的新方法,以解决在不损害整体性能的情况下从大型语言模型(LLM)中移除特定信息的挑战。由于在识别关键参数方面存在局限性,现有技术常常难以平衡遗忘不需要的数据和保留有用信息。REGLU 利用表示空间的几何特性和 LoRA 的新颖初始化来精确定位用于选择性遗忘的参数,同时正则化损失确保对模型保留知识的影响最小。在 TOFU 和 WMDP 等基准测试上的评估表明,REGLU 在遗忘质量和模…