open-weight language models
PulseAugur coverage of open-weight language models — every cluster mentioning open-weight language models across labs, papers, and developer communities, ranked by signal.
-
新方法通过权重分析验证开源语言模型溯源 · 已追踪 2 个来源
研究人员开发了一种名为中心化残差签名的新方法,用于验证开源语言模型的溯源。该技术分析模型权重,以确定检查点是否共享祖先,即使在经过微调、量化或合并之后。该方法能够成功区分真正的后代模型和独立模型或蒸馏模型,在速度和鲁棒性方面优于现有基线,尤其是在识别相关和不相关的LLaMA-2检查点方面。
-
新方法预测语言模型激活引导的副作用
研究人员开发了一种预测语言模型中激活引导的意外副作用的方法。通过在67种行为和三个开放权重模型之间创建交叉效应矩阵,他们发现副作用很常见、有结构且通常不对称。研究表明,这些副作用在很大程度上是可预测的,其大小取决于目标行为,并且可以从未引导的表示中预测其方向,这有助于主动安全审计。
-
研究评估 41 个开放权重模型用于意图分类
一项新研究系统地评估了 41 个开放权重语言模型在零样本意图分类方面的性能,并评估了它们在计算、延迟和鲁棒性等各种约束条件下的表现。该研究分析了参数量从 135M 到 9B 的模型,涵盖了八个英语数据集和一个辅助的五样本数据集。主要发现表明,经过指令微调的 3B 模型可以优于一些 7B 的基础模型,在 MASSIVE 数据集上顶级模型之间的差异在统计学上无法区分,而 SNIPS 等热门基准测试已经饱和。研究还指出,指令微调对置信度校准…
-
新的字节前缀边际化方法改进语言模型蒸馏
研究人员开发了一种名为字节前缀边际化(BPM)的新方法,用于开放权重语言模型的在线策略蒸馏(OPD)。BPM通过在共享字节空间中重新表达教师模型在学生模型词汇表上的概率分布,解决了合并具有不同分词器的模型所面临的挑战。即使分词器不同,该方法也能确保概率质量的保留和准确映射。实验表明,当与Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7等模型一起使用时,BPM在数学和编程基准测试上的表现显著优于现有的跨分词器方法。
-
新的DLR-Lock方法保护开源权重语言模型
研究人员开发了一种名为DLR-Lock的新方法,以防止对开源权重语言模型的未经授权的修改。该技术用深度低秩残差网络替换标准的MLP,增加了反向传播期间的内存使用量,并使微调优化变得复杂。DLR-Lock旨在防御完全了解模型和防御策略的自适应攻击者,同时保留原始模型的能力,这一点已通过在LLM上的实验得到验证。