PulseAugur
实时 06:05:25
实体 Glue

Glue

PulseAugur coverage of Glue — every cluster mentioning Glue across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
13
90 天内 30
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 27
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/2 页 · 共 30 条
  1. RESEARCH · CL_211198 ·

    新的LoRA-GA^2算法增强大型模型微调

    研究人员推出LoRA-GA^2,这是一种新颖的微调算法,旨在改进现有大型模型的低秩适应(LoRA)方法。这种新方法利用了多步梯度信息(以前的方法未能完全捕捉),以更好地使LoRA更新与完全微调的结果保持一致。LoRA-GA^2包含一个轻量级多步梯度探测器、一个感知频谱的秩分配以及最优初始化,所有这些都不会增加GPU内存使用量。实验结果表明,LoRA-GA^2在GLUE、GSM8K和HumanEval等基准测试中优于其他LoRA变体。

  2. TOOL · CL_205951 ·

    新的FedPA-LoRA框架改进了联邦LLM微调

    研究人员推出FedPA-LoRA,一个旨在提高大型语言模型联邦微调效率和准确性的新框架。该新方法解决了在聚合本地模型更新和管理初始化误差方面的挑战,特别是在客户端可能具有不同秩的异构环境中。FedPA-LoRA确保本地优化的连续性,同时促进全局一致性,从而在自然语言理解和生成任务上提高了性能。实验表明,与现有方法相比,平均GLUE准确率提高了多达6.82个百分点。

  3. TOOL · CL_214826 ·

    新的FedPA-LoRA框架改进了联邦LLM微调

    研究人员开发了FedPA-LoRA,这是一个旨在提高大型语言模型联邦微调的效率和准确性的新框架。该方法解决了在异构客户端环境中聚合更新和保持优化因素连续性所面临的挑战。FedPA-LoRA旨在增强全局一致性,同时允许客户端特定的计算预算,在自然语言理解和生成任务中表现出显著的性能提升。

  4. TOOL · CL_196110 ·

    新的SeFoRA算法增强了大型神经网络的联邦微调

    研究人员推出了一种名为SeFoRA的新算法,该算法专为使用低秩适配(LoRA)的大型神经网络的联邦参数高效微调而设计。SeFoRA通过允许在联邦器上直接聚合本地更新的线性草图,解决了客户端使用不同LoRA秩带来的挑战。这种方法减轻了双线性不匹配,并允许在更小的子空间中进行聚合。一个秩同质版本SeFoRA-Ho进一步简化了适配器聚合。理论分析表明其收敛于一个稳定点,并且在RoBERTa-Large在GLUE数据集上微调的实验表明,SeF…

  5. TOOL · CL_196083 ·

    UniF-MoE 框架统一自适应 MoE 计算,提高效率

    研究人员推出了一种新颖的混合专家(MoE)计算框架 UniF-MoE,该框架统一了各种自适应策略。该方法将专家分解为块,允许先进行共享计算,然后再路由剩余部分。在 DomainBed 和 GLUE 基准测试上的实验表明,与现有的静态和动态 MoE 模型相比,UniF-MoE 在提高预测性能的同时,还减少了激活的计算量、推理延迟和内存使用量。

  6. TOOL · CL_190770 ·

    云工程师应了解的 EC2 和 S3 之外的 AWS AI/ML 服务

    本文重点介绍了云和 DevOps 工程师应了解的 15 项 AWS AI 和机器学习服务,超越了 EC2 和 S3 等基础服务。它涵盖了为各种机器学习任务设计的系列产品,包括数据处理、模型训练和自然语言处理。

  7. TOOL · CL_187306 ·

    新的 SiPE 方法通过句法结构增强 Transformer

    研究人员开发了语法感知位置嵌入(SiPE),一种通过整合句法结构来增强 Transformer 模型的新颖方法。SiPE 在预训练期间从依赖解析中学习句法先验,并将其整合到现有的位置嵌入家族中。这种方法在句法泛化任务上的性能提高了 10.3%,困惑度降低了 9.0%,而不会降低其他指标。此外,SiPE 提升了现实世界的语言理解能力,在 GLUE 基准测试上的得分提高了 8.2%。

  8. RESEARCH · CL_195677 ·

    新研究增强 Transformer 位置编码以更好地理解语言

    两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…

  9. TOOL · CL_178496 ·

    新的M-TTFS编码提升了SNN在LLM上的能效

    研究人员开发了一种名为掩码首次脉冲时间(M-TTFS)的新编码方法,用于脉冲神经网络(SNN),以提高大型语言模型(LLM)的能效。M-TTFS编码重新分配了通常不传输任何信息的静默状态,以表示最常见的激活值,从而减少了与数据移动和权重读取相关的能耗。该方法被应用于一个名为Matterhorn的脉冲变压器模型,该模型在GLUE基准测试上取得了1.42个百分点的提升,并比之前的脉冲变压器消耗的能量减少了67%,同时在LLaMA模型上也显…

  10. TOOL · CL_178274 ·

    新研究比较联邦预训练的评估方法

    一篇新研究论文探讨了评估联邦预训练的挑战,这是一种在不集中化的前提下在分布式数据上训练模型的方法。研究强调,在GLUE等基准上的下游微调可能无法可靠地反映联邦预训练的质量。相反,预训练期间的直接下一个词预测与预训练测试困惑度显示出更强的对应关系,表明它是更可靠的评估信号。

  11. TOOL · CL_172340 ·

    Google Cloud 的无边界湖仓一体整合 AWS、Databricks、Snowflake 的数据

    Google Cloud 推出了新的“无边界湖仓一体”计划,旨在消除跨不同云平台复制数据的需求。该服务目前处于预览阶段,允许数据管道和代理通过 Iceberg REST 目录直接访问位于 AWS Glue、Databricks Unity Catalog 和 Snowflake Horizon 中的数据。此外,Google 还为跨云数据传输提供统一费率定价层,并发布了一个开源 Data Agent Kit,该套件与 Model Con…

  12. TOOL · CL_167168 ·

    新的 cMoLLM 架构通过动态卷积缩放 LLM

    研究人员推出了一种新颖的大型语言模型缩放方法 cMoLLM,该方法将混合专家(MoE)风格融入整个模型管道,而不仅仅是前馈网络。该方法将 MoE 层重新构建为动态卷积,允许进行条件于输入的核聚合以及端到端流的可微分路由。在 FineWeb 数据集上使用 GPT-2 风格模型进行的实验表明,在匹配的计算预算下,cMoLLM 提高了语言建模困惑度和下游任务的准确性,与 ParaScale 和 AltUp 等现有方法相比,显示出更稳定的优化…

  13. RESEARCH · CL_165163 ·

    新研究探索用于LLM的优化LoRA微调方法 · 跟踪4个来源

    研究人员正在探索优化低秩适配(LoRA)以微调大型语言模型的新方法。一种方法,统一LoRA(ULoRA),引入了一个可预训练梯度初始化的连续体,该连续体可以针对特定任务进行调整,潜在地匹配或超越完全微调的性能。另一种方法,Manifold-LoRA,将LoRA重新表述为流形优化问题,使用无回缩算法来加速训练并提高下游性能。此外,一种相似性度量方法侧重于仅微调最相关的层,在性能损失最小的情况下将可训练参数减少多达50%。最后,一个称为“…

  14. RESEARCH · CL_158482 ·

    新研究探索自适应秩分配以实现高效的LLM微调

    两篇新研究论文介绍了参数高效微调(PEFT)大型语言模型的先进方法。第一篇论文提出了LAARA框架,该框架根据轻量级Fisher估计动态地为不同的Transformer层分配适配器秩,在GLUE和MathInstruct等基准测试中的参数效率和性能方面优于LoRA和AdaLoRA等现有方法。第二篇论文StatLoRA将秩分配视为一个统计假设检验问题,利用从AdamW等优化器的渐近正态性理论导出的估计p值来确定保留哪些组件。实验表明,S…

  15. TOOL · CL_156418 ·

    新框架通过动态聚类和压缩解决 MoE LLM 的三难困境

    研究人员开发了一个新框架,以解决混合专家(MoE)大型语言模型(LLM)面临的三难困境,该困境涉及负载不平衡、参数冗余和通信开销。他们的方法使用动态专家聚类和结构化压缩,根据参数和激活相似性定期重新组合专家以稳定利用率。这种方法将每个组的参数减少多达五倍,同时保持专业化,从而带来显著的效率提升。在 GLUE 和 WikiText-103 上的评估表明,该框架在保持标准 MoE 模型质量的同时,总参数减少了约 80%,吞吐量提高了 10…

  16. TOOL · CL_154133 ·

    新的SOS-LoRA方法提升了LLM在推理和数学任务上的性能

    研究人员推出了一种新颖的参数高效微调方法SOS-LoRA,旨在提升大型语言模型的性能。该技术将总秩分解到多个低秩专家中,采用固定的多尺度缩放策略来分离优化动态,并通过正交初始化和正则化鼓励输入方向的多样性。在推理、知识和数学基准测试中,SOS-LoRA相比标准的LoRA和其他变体提供了持续的改进,并且在推理时不会引入额外的参数或延迟。

  17. RESEARCH · CL_131359 ·

    新方法降低嵌入式GPU上SLM微调的能耗

    研究人员开发了一种面向资源受限嵌入式设备的SLM(小型语言模型)微调的能效方法。该研究在GLUE基准测试上对BERT和Pythia变体进行了微调行为的表征,并提出了基于机器学习的模型选择,以优化GPU DVFS设置。在NVIDIA Jetson AGX Orin上的实验表明,与默认的MAXN模式0相比,平均能耗节省了13.11%,节省幅度高达26.73%。

  18. TOOL · CL_129193 ·

    SAD-LoRA 通过谱对齐改进低秩知识蒸馏

    研究人员推出了一种新颖的低秩知识蒸馏方法 SAD-LoRA,该方法专注于对齐适配器权重子空间的谱属性。该方法旨在通过确保适配器占据教师模型更新的相关子空间来改进参数高效压缩。在合成数据和 RoBERTa-large 到 RoBERTa-base 在 GLUE 任务上的蒸馏实验表明,SAD-LoRA 显著增强了子空间对齐和秩效率,在低秩设置下优于现有的谱基线。

  19. TOOL · CL_128881 ·

    CrossBERT架构分离表示与重建,实现可扩展文本编码器

    研究人员推出了一种新颖的文本编码器架构CrossBERT,旨在克服BERT类模型的局限性。与BERT将表示学习与token重建混淆不同,CrossBERT将这两个目标分开。这种架构改变允许更高的掩码比例和改进的梯度收集,从而使吞吐量提高1.5倍至2倍,样本效率提高2倍。CrossBERT在MTEB(eng, v2)和frozen GLUE等基准测试中表现出持续的扩展性和卓越的性能。

  20. TOOL · CL_100065 ·

    ITNet架构统一了卷积、注意力和循环

    研究人员推出了一种新颖的神经网络架构ITNet,它将卷积、注意力和循环统一为一种可学习的积分变换。该架构使用一个可学习的核(实现为MLP)来模拟成对交互,使其能够根据数据调整其行为。通过调整参数,ITNet可以恢复各种现有架构的功能,包括LSTM、GRU、S4、Mamba和自注意力。该模型在ImageNet-1K、GLUE、ModelNet40、VQA v2和NLVR2等多个基准测试中都表现出具有竞争力或更优的性能。