PulseAugur
实时 04:07:40
实体 LLaMA-2 7B

LLaMA-2 7B

PulseAugur coverage of LLaMA-2 7B — every cluster mentioning LLaMA-2 7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 24
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_208800 ·

    AI模型扩展定律将焦点从参数数量转移

    AI模型的最优扩展不仅仅涉及参数数量,训练数据、计算分配和推理成本等因素也起着至关重要的作用。早期研究表明参数与数据比率较高,但后续研究表明更均衡的方法,尤其是在考虑推理成本时。Mixture-of-Experts (MoE) 模型进一步增加了复杂性,因为总参数决定了知识容量,而激活的参数则影响推理深度。Z.ai 的 GLM-5.3 版本表明,通过专注于训练后增强,例如扩展长视野环境和强化学习,而不是仅仅增加基础模型大小或预训练数据,…

  2. TOOL · CL_203992 ·

    新的BAT系统使用LLM进行空间声音推理

    研究人员开发了BAT,一个结合了双耳声景分析模型和大型语言模型(LLM)以实现空间声音推理的系统。为此,他们通过合成AudioSet和SoundSpaces 2.0的空间音频创建了一个新数据集,并开发了SpatialSoundQA,一个用于空间声音感知的问答数据集。该系统的声学前端,即空间音频频谱Transformer(Spatial-AST),在声音事件检测、定位和距离估计方面表现出色。当与LLaMA-2 7B模型集成时,BAT在空…

  3. TOOL · CL_196038 ·

    Astrolabe系统通过随机预测引导调度优化大语言模型服务

    研究人员开发了Astrolabe,一个旨在优化大语言模型(LLM)服务的新型调度系统。该系统采用随机预测引导的方法,在无需昂贵的基于迁移的重新平衡的情况下,平衡多个LLM实例之间的负载。Astrolabe结合了响应长度估计、延迟预测和power-of-two-choices调度策略,以增强负载平衡并降低延迟。实验表明,Astrolabe可以匹配或超越现有基线的性能,显著降低平均和P99的首个token时间和端到端延迟,同时还减少了预测…

  4. RESEARCH · CL_196087 ·

    新的量化方法旨在降低LLM的计算成本

    两篇新的研究论文介绍了一种量化大型语言模型(LLM)的新颖方法,以减少其计算足迹。LoRAQuant专注于低秩自适应(LoRA)适配器的混合精度量化,使用奇异值分解将重要信息集中到更高精度的组件中,同时将其余部分量化为超低比特宽度。ReRound通过采用具有条件扩散模型的重构舍入技术来解决无校准量化中的中点歧义,特别有利于较小的LLM,并优于标准的四舍五入到最近的方法。

  5. TOOL · CL_180878 ·

    新的几何框架分析大型语言模型注意力中的 token 选择

    研究人员开发了一个新的几何框架来分析大型语言模型(LLMs)中多头注意力的行为。该方法将注意力视为 value-state 空间内的 top-N 选择过程,定义了精确率、召回率和 F 分数等指标来衡量 token 的可分离性。该理论预测了最佳操作模式,并解释了序列长度和 token 相似性如何影响这些指标。对 LLaMA-2-7B、Gemma-7B 和 Mistral-7B 模型的实证测试表明,注意力功能类似于结构化的几何分类器,从而…

  6. RESEARCH · CL_165163 ·

    新研究探索用于LLM的优化LoRA微调方法 · 跟踪4个来源

    研究人员正在探索优化低秩适配(LoRA)以微调大型语言模型的新方法。一种方法,统一LoRA(ULoRA),引入了一个可预训练梯度初始化的连续体,该连续体可以针对特定任务进行调整,潜在地匹配或超越完全微调的性能。另一种方法,Manifold-LoRA,将LoRA重新表述为流形优化问题,使用无回缩算法来加速训练并提高下游性能。此外,一种相似性度量方法侧重于仅微调最相关的层,在性能损失最小的情况下将可训练参数减少多达50%。最后,一个称为“…

  7. TOOL · CL_160852 ·

    GaugeQuant 通过学习模型对称性来优化大语言模型量化

    研究人员开发了 GaugeQuant,一种利用大语言模型(LLMs)内部对称性来优化其量化过程的新颖方法。该技术在训练损失中引入了一个 LogSumExp 项,引导模型选择量化最优基,而无需校准数据或模拟。在 W4A4 量化下对 LLaMA-2 7B 模型进行的实验显示,困惑度从 8.22 显著降低到 6.73,优于一些训练后量化方法。在 W4A16 量化下观察到进一步改进,困惑度从 11.16 下降到 5.45。

  8. TOOL · CL_156552 ·

    SHUFFLESPARSE学习的置换可提高结构化稀疏网络的准确性

    研究人员开发了SHUFFLESPARSE,一种新颖的置换原语,旨在增强神经网络中的结构化权重稀疏性。该方法旨在缩小结构化和非结构化稀疏训练之间的准确性差距,尤其是在高稀疏度水平下。通过与权重矩阵一起学习置换矩阵,SHUFFLESPARSE在ViT-B16和GPT-2等模型的准确性方面显示出显著的改进,并显著将LLaMA-2 7B的零样本准确性提高了4.6个百分点。

  9. RESEARCH · CL_133157 ·

    PALS方法通过调整层级稀疏性来改进LLM剪枝

    研究人员开发了PALS(Percentile-Aware Layerwise Sparsity),一种用于剪枝大型语言模型的新颖方法。与现有的应用统一稀疏性的一次性方法不同,PALS根据激活幅度动态调整每层的稀疏性比例。这种方法在LLaMA-2-7B的困惑度方面显示出显著的改进,取得了比统一剪枝方法更好的结果。然而,其益处依赖于架构,LLaMA-3-8B仅显示边际收益,而Mistral-7B则没有显示任何收益。

  10. TOOL · CL_106820 ·

    新的SVD-Surgeon方法无需重新训练即可优化LLM压缩

    研究人员开发了SVD-Surgeon,一种新颖的、无需训练即可使用奇异值分解(SVD)压缩大型语言模型(LLM)的方法。该技术直接优化奇异值,提供一种封闭形式的更新,以补偿移除的组件并识别要修剪的值。当应用于现有的SVD压缩器(如SVD-LLM)时,SVD-Surgeon在不重新训练的情况下,提高了OPT和LLaMA 2-7B等模型的困惑度-压缩权衡。

  11. RESEARCH · CL_70422 ·

    新的 TaDA 算法使用深度感知门控来合并 LoRA 适配器

    研究人员推出了一种新算法 TaDA,用于合并 Transformer 模型中特定任务和特定领域的 LoRA 适配器。与之前应用统一权重的方​​法不同,TaDA 利用了任务和领域信号之间观察到的深度依赖不对称性。该算法使用校准的探针引导门控进行每层加权和子空间感知合并,以有效地组合适配器组件。这种无需训练的方法会产生一个标准的 LoRA 适配器,没有推理开销,并在科学问答和图像分类基准测试中表现出卓越的性能。

  12. RESEARCH · CL_63012 ·

    新研究应对AI的灾难性遗忘问题

    多篇研究论文探讨了持续学习的先进技术,旨在防止AI模型的灾难性遗忘。一种方法“经验混合”(Experience Blending, EB)使用生成的“支持边界数据”来丰富决策边界并提高图像分类等任务的准确性。另一种方法TeLAPA通过组织多样化的策略邻域而非依赖单一演进策略来解决持续强化学习问题,从而增强适应性和重用性。其他研究则探讨了任务粒度对遗忘的影响,提出了用于监控大型预训练模型在线学习的LargeMonitor等框架,并引入了…

  13. RESEARCH · CL_50600 ·

    新研究探讨Transformer模型的量化优势

    两篇新研究论文探讨了提高Transformer模型效率的方法,特别是在边缘设备上部署方面。第一篇论文介绍了OrpQuant,一个无乘法器、二的幂量化的框架,将LLaMA-2-7B等模型的校准时间缩短至约15分钟。第二篇论文研究了残差自由Transformer,证明它们通过保持近乎高斯激活,比传统残差模型对低比特量化表现出更强的鲁棒性。

  14. RESEARCH · CL_48592 ·

    新的SymNoise方法提升LLM微调性能

    研究人员推出了一种名为SymNoise的新型语言模型微调方法,该方法利用嵌入中的对称噪声。该技术旨在通过更精确地调节局部曲率来提高模型性能,优于现有的最先进方法NEFTune。在实验中,SymNoise将使用Alpaca微调的LLaMA-2-7B的AlpacaEval分数从29.79%显著提升至69.04%,比NEFTune的64.69%提高了6.7%。该方法在各种模型和数据集上均持续优于NEFTune。

  15. RESEARCH · CL_48868 ·

    新方法提升LLM量化效率与准确性

    研究人员开发了多种新方法来提高大型语言模型(LLM)量化的效率和准确性。这些技术旨在减少LLM的内存占用和计算成本,使其更容易部署在资源受限的设备上。创新包括混合专家(MoE)模型的无校准比特分配、利用量化漏洞的异常值注入以及硬件友好的混合精度量化框架。

  16. RESEARCH · CL_48735 ·

    文化演化理论解释模型崩溃

    研究人员将模型崩溃(大型语言模型在训练自身输出来进行训练时会退化)这一现象重新解读为一种文化演化过程。通过应用迭代学习理论,他们使用LLaMA-2-7B和Mistral-7B模型在多种语言上推导并测试了五个预测。一个关键发现是,在未经筛选的自训练过程中,组合性最初会增加然后减少,这种模式即使在正则化数据下也持续存在,并且只有通过任务基础的筛选才能缓解。

  17. TOOL · CL_42492 ·

    新指标揭示语言模型如何处理隐喻

    研究人员开发了一种名为条件尺度熵(CSE)的新指标,用于分析仅解码器语言模型如何处理隐喻。CSE 衡量了 Transformer 层内不同频率尺度上的计算参与广度。使用 CSE 进行的研究表明,在参数量从 1.24 亿到 200 亿不等的模型中,包括 GPT-2、LLaMA-2 和 GPT-oss 等架构,隐喻性词元相比字面性词元始终激活更广泛的计算尺度。

  18. TOOL · CL_40773 ·

    新方法利用序列熵变化检测对抗性LLM提示

    研究人员开发了一种名为CPD Online的新方法来检测试图越狱大型语言模型的对抗性提示。该技术将提示检测视为在线变化点检测问题,分析模型令牌预测中的序列熵变化。CPD Online不依赖于特定模型,无需训练,并且能够精确定位恶意提示的开始,在各种开源模型上表现优于现有的困惑度检测器。

  19. RESEARCH · CL_38164 ·

    新的探测方法揭示 Llama 2 表示中的概念流形

    研究人员开发了一种名为流形探测器(Manifold Probe)的新方法,用于识别和理解概念在人工智能模型中的表示方式。该技术将线性回归探测器扩展到发现和学习用于编码特定特征的方向。当应用于 Llama 2-7b 时,流形探测器成功识别了时间和空间的概念流形,并且操纵时间流形会影响模型关于文化作品发布日期的输出。

  20. TOOL · CL_22110 ·

    新研究量化了压缩Transformer中的误差传播

    研究人员开发了一种方法,以更好地理解和管理压缩Transformer模型中的误差传播。通过测量每层输出与输入误差之比(rho),他们发现误差会可预测地累积,解释了为什么压缩早期层会更具破坏性。该分析还揭示了层内组件敏感性存在显著差异,表明重要性分数在不同模型架构之间转移不佳。该研究提出了一种无需训练的方法,利用这些压缩配置文件来指导在层内何处进行压缩以及完全移除哪些层,从而在不显著损失性能的情况下提高效率。