Glue
PulseAugur coverage of Glue — every cluster mentioning Glue across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的 PiERN 架构将精确计算与大型语言模型相结合
研究人员开发了一种名为 Physically-isolated Experts Routing Network (PiERN) 的新架构,旨在将高精度数值计算与大型语言模型集成。PiERN 能够在单一的思维链中迭代地交替进行计算和推理,从而提高复杂任务的准确性和效率。在 PDEBench 和电池管理任务等基准测试上的评估表明,PiERN 在准确性、延迟、令牌使用和能耗方面优于直接微调的大型语言模型,同时在 MMLU 和 GLUE 等标…
-
TabiBERT:发布新的土耳其语基础模型和基准
研究人员推出了 TabiBERT,一个基于 ModernBERT 架构的新型大规模土耳其语基础模型。该模型在超过一万亿个 token 的海量数据集上进行了训练,涵盖了网络文本、科学出版物和源代码,并支持 8,192 个 token 的上下文长度。为了评估 TabiBERT,开发了一个名为 TabiBench 的新基准,该基准包含八个任务类别中的 27 个数据集。与之前的土耳其语模型相比,TabiBERT 在问答和代码检索任务上表现出了卓越的性能。
-
新的JIVEAdapter方法提高了LLM微调效率
研究人员开发了JIVEAdapter,一种用于大型语言模型参数高效微调的新颖方法。与现有的单任务适配器不同,JIVEAdapter将权重更新分解为共享的“联合”结构和任务特定的“个体”结构。这种方法旨在更好地分离共享知识与任务特定的适应性,从而提高可解释性和效率。该方法在使用DeBERTaV3-base模型在GLUE和SuperGLUE基准测试中表现出有竞争力的性能。
-
Temperon训练方法以更低成本实现SAM质量
研究人员推出了一种新颖的训练方法Temperon,旨在以显著降低的计算成本实现Sharpness-Aware Minimization (SAM) 的质量。Temperon采用两阶段方法:初始探索阶段使用标准SGD,然后在训练后期切换到SAM包装的Muon精炼器。该方法在CIFAR-10/100和Tiny ImageNet等各种数据集上已证明具有与全时SAM相当的准确性,并能更快地达到目标准确率。该方法在预训练GPT-2和针对GLUE…
-
仅限法语的 BabyLM 模型揭示分词器敏感性
研究人员开发了 MéTRON-FR,这是一个仅在法语文本上训练的 1.25 亿参数 GPT-2 模型,在法语特定基准测试中取得了显著分数。当使用跨语言 GLUE 协议进行评估时,该模型在关系任务上有所改进,但在世界知识任务上有所退步。研究还强调了分词器和提示模板在小规模模型性能上的显著影响,强调了对母语基准测试和敏感性分析的必要性。
-
新研究评估NLP文本分类器的隐私风险
一项新的arXiv研究评估了训练自然语言处理(NLP)文本分类器相关的隐私风险。研究人员使用TF-IDF + Logistic Regression模型和微调后的DistilBERT分类器,对GLUE SST-2情感数据集进行了成员推断攻击(MIAs)的基准测试。虽然DistilBERT取得了更高的准确率和F1分数,但两种模型都显示出成员信号的泄露。研究还探讨了轻量级缓解技术,发现更强的正则化可以在付出效用代价的情况下减少泄露,而微调…
-
新的RAPTOR框架增强了MoE AI模型的私有训练
研究人员开发了RAPTOR,一种用于专家混合(MoE)模型差分私有训练的新颖框架。现有方法将这些稀疏模型视为密集块,导致梯度抑制和更新稀释等问题。RAPTOR通过交替共享和专家优化、采用专家特定裁剪和噪声,以及使用无隐私规则来选择免受路由熵影响的层来解决这些问题。在Switch Transformer和OLMoE等模型上的实验表明,与标准的DP基线相比,性能持续提升,尤其是在更严格的隐私预算下。
-
Looped GPT-BERT模型在语言建模中用计算换参数
研究人员开发了一种名为 Looped GPT-BERT 的新型语言模型,该模型在语言和下游任务上取得了与现有模型相当的性能,同时使用的参数更少。这是通过采用深度参数共享和循环遍历来实现的,有效地用计算换参数。该模型在一个有限的英语语料库上进行了训练,并在 BabyLM 2026 Strict-small 设置下进行了评估,在 BLiMP 和 GLUE 等指标上显示出有希望的结果,尽管也注意到了由于循环设计可能在表示空间中存在局限性。
-
新方法增强LoRA在模型适应中的效率和稳定性
研究人员开发了两种新方法来提高参数高效模型适应中使用的低秩适应(LoRA)技术的效率和稳定性。归一化低秩适应(NoRA)在训练期间对降维矩阵进行归一化,以加速收敛并提高性能,而无需增加参数或计算开销。LoRA的激活边界匹配(ABM-LoRA)使用任务诱导的激活边界符号作为新适配器的目标,提高了LoRA对初始化的敏感度,并在各种基准测试中优于标准LoRA。
-
新的LoRA-GA^2算法增强大型模型微调
研究人员推出LoRA-GA^2,这是一种新颖的微调算法,旨在改进现有大型模型的低秩适应(LoRA)方法。这种新方法利用了多步梯度信息(以前的方法未能完全捕捉),以更好地使LoRA更新与完全微调的结果保持一致。LoRA-GA^2包含一个轻量级多步梯度探测器、一个感知频谱的秩分配以及最优初始化,所有这些都不会增加GPU内存使用量。实验结果表明,LoRA-GA^2在GLUE、GSM8K和HumanEval等基准测试中优于其他LoRA变体。
-
新的FedPA-LoRA框架改进了联邦LLM微调
研究人员推出FedPA-LoRA,一个旨在提高大型语言模型联邦微调效率和准确性的新框架。该新方法解决了在聚合本地模型更新和管理初始化误差方面的挑战,特别是在客户端可能具有不同秩的异构环境中。FedPA-LoRA确保本地优化的连续性,同时促进全局一致性,从而在自然语言理解和生成任务上提高了性能。实验表明,与现有方法相比,平均GLUE准确率提高了多达6.82个百分点。
-
新的FedPA-LoRA框架改进了联邦LLM微调
研究人员开发了FedPA-LoRA,这是一个旨在提高大型语言模型联邦微调的效率和准确性的新框架。该方法解决了在异构客户端环境中聚合更新和保持优化因素连续性所面临的挑战。FedPA-LoRA旨在增强全局一致性,同时允许客户端特定的计算预算,在自然语言理解和生成任务中表现出显著的性能提升。
-
新的SeFoRA算法增强了大型神经网络的联邦微调
研究人员推出了一种名为SeFoRA的新算法,该算法专为使用低秩适配(LoRA)的大型神经网络的联邦参数高效微调而设计。SeFoRA通过允许在联邦器上直接聚合本地更新的线性草图,解决了客户端使用不同LoRA秩带来的挑战。这种方法减轻了双线性不匹配,并允许在更小的子空间中进行聚合。一个秩同质版本SeFoRA-Ho进一步简化了适配器聚合。理论分析表明其收敛于一个稳定点,并且在RoBERTa-Large在GLUE数据集上微调的实验表明,SeF…
-
UniF-MoE 框架统一自适应 MoE 计算,提高效率
研究人员推出了一种新颖的混合专家(MoE)计算框架 UniF-MoE,该框架统一了各种自适应策略。该方法将专家分解为块,允许先进行共享计算,然后再路由剩余部分。在 DomainBed 和 GLUE 基准测试上的实验表明,与现有的静态和动态 MoE 模型相比,UniF-MoE 在提高预测性能的同时,还减少了激活的计算量、推理延迟和内存使用量。
-
云工程师应了解的 EC2 和 S3 之外的 AWS AI/ML 服务
本文重点介绍了云和 DevOps 工程师应了解的 15 项 AWS AI 和机器学习服务,超越了 EC2 和 S3 等基础服务。它涵盖了为各种机器学习任务设计的系列产品,包括数据处理、模型训练和自然语言处理。
-
新的 SiPE 方法通过句法结构增强 Transformer
研究人员开发了语法感知位置嵌入(SiPE),一种通过整合句法结构来增强 Transformer 模型的新颖方法。SiPE 在预训练期间从依赖解析中学习句法先验,并将其整合到现有的位置嵌入家族中。这种方法在句法泛化任务上的性能提高了 10.3%,困惑度降低了 9.0%,而不会降低其他指标。此外,SiPE 提升了现实世界的语言理解能力,在 GLUE 基准测试上的得分提高了 8.2%。
-
新研究增强 Transformer 位置编码以更好地理解语言
两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…
-
新的M-TTFS编码提升了SNN在LLM上的能效
研究人员开发了一种名为掩码首次脉冲时间(M-TTFS)的新编码方法,用于脉冲神经网络(SNN),以提高大型语言模型(LLM)的能效。M-TTFS编码重新分配了通常不传输任何信息的静默状态,以表示最常见的激活值,从而减少了与数据移动和权重读取相关的能耗。该方法被应用于一个名为Matterhorn的脉冲变压器模型,该模型在GLUE基准测试上取得了1.42个百分点的提升,并比之前的脉冲变压器消耗的能量减少了67%,同时在LLaMA模型上也显…
-
新研究比较联邦预训练的评估方法
一篇新研究论文探讨了评估联邦预训练的挑战,这是一种在不集中化的前提下在分布式数据上训练模型的方法。研究强调,在GLUE等基准上的下游微调可能无法可靠地反映联邦预训练的质量。相反,预训练期间的直接下一个词预测与预训练测试困惑度显示出更强的对应关系,表明它是更可靠的评估信号。
-
Google Cloud 的无边界湖仓一体整合 AWS、Databricks、Snowflake 的数据
Google Cloud 推出了新的“无边界湖仓一体”计划,旨在消除跨不同云平台复制数据的需求。该服务目前处于预览阶段,允许数据管道和代理通过 Iceberg REST 目录直接访问位于 AWS Glue、Databricks Unity Catalog 和 Snowflake Horizon 中的数据。此外,Google 还为跨云数据传输提供统一费率定价层,并发布了一个开源 Data Agent Kit,该套件与 Model Con…