QNLI
PulseAugur coverage of QNLI — every cluster mentioning QNLI across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
分离的嵌入层提升私有LLM训练的准确性和效率
一篇新发表在arXiv上的研究论文探讨了在差分隐私随机梯度下降(DP-SGD)下对解码器专用大型语言模型(LLM)进行微调时,权重绑定的影响。研究发现,在SST-2和QNLI等基准测试中,分离输入和输出嵌入层的模型始终优于权重绑定模型,准确率提升高达4.74%。此外,分离的嵌入层通过启用幽灵裁剪(ghost clipping),使得DP-SGD训练更节省内存,与权重绑定模型相比,内存使用量降低了60%以上。
-
量子 NLP 模型在 SPSA 超参数调优方面遇到困难
一篇新的 arXiv 论文探讨了变分量子自然语言推理 (VQ-NLI) 模型的超参数调优。研究调查了同步扰动随机逼近 (SPSA) 相较于参数移位梯度法的有效性。尽管 AdamW 风格的 SPSA 取得了一些改进,但由于其梯度估计的高方差,尤其是在参数量较大的模型中,其性能仍落后于参数移位基线。
-
新框架实现跨模型规模的知识迁移
研究人员开发了一种名为 Activation-Prune-Merge (APM) 的新颖框架,通过从更大、架构不同的模型迁移知识来增强较小的语言模型。APM 根据任务条件激活图谱,从供体模型中识别并提取层、隐藏维度和注意力头等关键组件。然后,将提取的切片以小的插值系数注入到接收模型中,从而在无需精确结构对齐的情况下提高其能力。该方法在 16 个基准测试中显示出显著的准确性提升,包括在 RTE、QNLI 和 BoolQ 上的显著改进,表…
-
新的LoRA-Diffusion方法实现了扩散语言模型的参数高效微调
研究人员推出了一种新颖的参数高效微调方法LoRA-Diffusion,该方法专为基于扩散的语言模型设计。与修改模型权重的现有方法不同,LoRA-Diffusion将低秩分解应用于去噪轨迹,学习整个扩散路径上的扰动。这种方法允许以更少的存储需求进行任务特定定制,并在SST-2、QNLI和MRPC等基准测试中表现出色,为适应扩散语言模型建立了一个新框架。