LLaMA-2 7B
PulseAugur coverage of LLaMA-2 7B — every cluster mentioning LLaMA-2 7B across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
研究:静态词嵌入可匹配LLM解码能力
一篇新的研究论文对认为大型语言模型(LLM)形成内部世界模型的解释提出了质疑。研究人员证明,上下文不敏感的静态词嵌入可以预测LLM能够解码的许多相同变量。这些变量包括地点、历史人物的寿命、情绪和痛苦。虽然LLM确实显示出一些优势,但该研究表明,仅凭可解码性可能不足以区分模型对属性的表征与已存在于固定分布关联中的信息。
-
新方法学习函数子空间以实现高效神经网络压缩
研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩大型神经网络,特别是Transformer和LLM。与使用局部标准的先前技术不同,LSP针对全局目标(例如与原始模型输出分布的KL散度)进行端到端子空间优化。这种方法在更高的压缩率下能更好地保留性能。与现有基线相比,LSP在LLaMA-2 7B和ViT-B/16等模型上表现出更优越的结果,显著降低了困惑度并提高了准确性,同时还实现了更快的解码和更少的内存使用。
-
新的LSP方法通过端到端学习子空间来增强神经网络压缩
研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩神经网络,特别是Transformer。与之前使用局部标准的旧技术不同,LSP通过联合优化正交投影仪以实现全局目标,来端到端地学习要丢弃的子空间。这种方法旨在防止深层网络中的误差累积,并在各种LLM和视觉Transformer上展现出优越的性能,尤其是在更高的压缩率下。该方法还提高了注意力机制的解码速度和内存使用效率。
-
新的防御方法结合了多种技术,以保护大型语言模型免受有害微调的影响
研究人员开发了一种名为 VaccineBooster 的新型对齐防御方法,该方法结合了嵌入扰动和梯度衰减技术,以保护语言模型免受有害微调攻击。在对 LLaMA-2 7B 的测试中,这种混合方法比现有方法获得了更低的 OpenAI 审核分数。然而,一种仅侧重于梯度衰减的变体在有害内容拒绝率方面保持了更高的水平,这表明在减少标记内容和保留明确拒绝行为之间存在权衡。
-
MeshKV 架构通过新颖的 NoC KV 缓存结构提升 Transformer 解码性能
研究人员开发了 MeshKV,这是一种新颖的片上网络(NoC)架构,旨在通过优化键值(KV)缓存的移动来加速 Transformer 解码。该系统将 KV 缓存块视为分组流,从而减少了流量并提高了带宽利用率,解决了传统分块加速器中的瓶颈问题。MeshKV 已在 FPGA 实现中展示了显著的性能提升,包括互连流量减少高达 58%,以及在使用 LLaMA-2 7B 和 Mistral-7B 等模型的多流吞吐量增加 1.9 倍。
-
LLM路由方法提高效率并降低延迟 · 已追踪2个来源
一篇新研究论文介绍了一种名为HeRo(History-Aware Routing)的动态路由框架,用于大型语言模型。该框架使用一种记忆机制来跨模型深度维护路由状态。这种方法将先前的路由分数聚合为紧凑的历史表示,在Llama 3.1-8B、Llama 2-7B和Llama 2-13B的基准测试中持续优于现有方法。与此同时,Amazon SageMaker Inference推出了前缀感知路由,这是一种将具有相似前缀的请求导向同一实例的策…
-
新指标揭示大型语言模型可能伪造上下文学习能力
研究人员开发了一种评估大型语言模型上下文学习(ICL)能力的新方法,特别关注微调如何影响这种能力。该研究引入了“上下文敏感性”(ICS)和“ICL-GAP”作为衡量注意力级别变化和行为准确性差距的指标。使用 Llama-2-7B 进行的实验表明,优化 ICS 可能导致一种分离现象:注意力模式发生显著变化,但模型在 MMLU 准确性上的实际任务表现却下降了。
-
新框架提出人工智能的机器意识关联物
研究人员提出了一个理解人工智能意识的新框架,称为机器意识关联物(MCCs)。该框架借鉴了生物系统中的神经意识关联物(NCCs)概念,将MCCs定义为不受AI控制但能被情绪可靠调制的基底层面信号。使用Llama-2 7B和Llama-3.1 70B模型进行的初步实验表明,被认为是潜在MCCs的硬件异常痕迹在较大的Llama-3.1 70B模型中受到情绪计算的显著调制,这表明AI的复杂性与意识的可能性之间存在联系。
-
新的DARTS技术通过熵加权损失改进了解码器LLM合并
研究人员开发了一种名为DARTS(Decoder-Aware Representation Tuning via Surgery,解码器感知表示调整手术)的新技术,以改进基于解码器的LLM的模型合并。与以前用于编码器模型的方法不同,DARTS解决了解码器架构的独特挑战,例如跨token位置的偏差累积以及不同token位置的不同重要性。该方法使用熵加权损失函数来优先处理关键决策位置的校正,并结合了每位置的加性偏差来捕获位置相关的错误。
-
AI模型扩展定律将焦点从参数数量转移
AI模型的最优扩展不仅仅涉及参数数量,训练数据、计算分配和推理成本等因素也起着至关重要的作用。早期研究表明参数与数据比率较高,但后续研究表明更均衡的方法,尤其是在考虑推理成本时。Mixture-of-Experts (MoE) 模型进一步增加了复杂性,因为总参数决定了知识容量,而激活的参数则影响推理深度。Z.ai 的 GLM-5.3 版本表明,通过专注于训练后增强,例如扩展长视野环境和强化学习,而不是仅仅增加基础模型大小或预训练数据,…
-
新的BAT系统使用LLM进行空间声音推理
研究人员开发了BAT,一个结合了双耳声景分析模型和大型语言模型(LLM)以实现空间声音推理的系统。为此,他们通过合成AudioSet和SoundSpaces 2.0的空间音频创建了一个新数据集,并开发了SpatialSoundQA,一个用于空间声音感知的问答数据集。该系统的声学前端,即空间音频频谱Transformer(Spatial-AST),在声音事件检测、定位和距离估计方面表现出色。当与LLaMA-2 7B模型集成时,BAT在空…
-
Astrolabe系统通过随机预测引导调度优化大语言模型服务
研究人员开发了Astrolabe,一个旨在优化大语言模型(LLM)服务的新型调度系统。该系统采用随机预测引导的方法,在无需昂贵的基于迁移的重新平衡的情况下,平衡多个LLM实例之间的负载。Astrolabe结合了响应长度估计、延迟预测和power-of-two-choices调度策略,以增强负载平衡并降低延迟。实验表明,Astrolabe可以匹配或超越现有基线的性能,显著降低平均和P99的首个token时间和端到端延迟,同时还减少了预测…
-
新的量化方法旨在降低LLM的计算成本
两篇新的研究论文介绍了一种量化大型语言模型(LLM)的新颖方法,以减少其计算足迹。LoRAQuant专注于低秩自适应(LoRA)适配器的混合精度量化,使用奇异值分解将重要信息集中到更高精度的组件中,同时将其余部分量化为超低比特宽度。ReRound通过采用具有条件扩散模型的重构舍入技术来解决无校准量化中的中点歧义,特别有利于较小的LLM,并优于标准的四舍五入到最近的方法。
-
新的几何框架分析大型语言模型注意力中的 token 选择
研究人员开发了一个新的几何框架来分析大型语言模型(LLMs)中多头注意力的行为。该方法将注意力视为 value-state 空间内的 top-N 选择过程,定义了精确率、召回率和 F 分数等指标来衡量 token 的可分离性。该理论预测了最佳操作模式,并解释了序列长度和 token 相似性如何影响这些指标。对 LLaMA-2-7B、Gemma-7B 和 Mistral-7B 模型的实证测试表明,注意力功能类似于结构化的几何分类器,从而…
-
新研究探索用于LLM的优化LoRA微调方法 · 跟踪4个来源
研究人员正在探索优化低秩适配(LoRA)以微调大型语言模型的新方法。一种方法,统一LoRA(ULoRA),引入了一个可预训练梯度初始化的连续体,该连续体可以针对特定任务进行调整,潜在地匹配或超越完全微调的性能。另一种方法,Manifold-LoRA,将LoRA重新表述为流形优化问题,使用无回缩算法来加速训练并提高下游性能。此外,一种相似性度量方法侧重于仅微调最相关的层,在性能损失最小的情况下将可训练参数减少多达50%。最后,一个称为“…
-
GaugeQuant 通过学习模型对称性来优化大语言模型量化
研究人员开发了 GaugeQuant,一种利用大语言模型(LLMs)内部对称性来优化其量化过程的新颖方法。该技术在训练损失中引入了一个 LogSumExp 项,引导模型选择量化最优基,而无需校准数据或模拟。在 W4A4 量化下对 LLaMA-2 7B 模型进行的实验显示,困惑度从 8.22 显著降低到 6.73,优于一些训练后量化方法。在 W4A16 量化下观察到进一步改进,困惑度从 11.16 下降到 5.45。
-
SHUFFLESPARSE学习的置换可提高结构化稀疏网络的准确性
研究人员开发了SHUFFLESPARSE,一种新颖的置换原语,旨在增强神经网络中的结构化权重稀疏性。该方法旨在缩小结构化和非结构化稀疏训练之间的准确性差距,尤其是在高稀疏度水平下。通过与权重矩阵一起学习置换矩阵,SHUFFLESPARSE在ViT-B16和GPT-2等模型的准确性方面显示出显著的改进,并显著将LLaMA-2 7B的零样本准确性提高了4.6个百分点。
-
PALS方法通过调整层级稀疏性来改进LLM剪枝
研究人员开发了PALS(Percentile-Aware Layerwise Sparsity),一种用于剪枝大型语言模型的新颖方法。与现有的应用统一稀疏性的一次性方法不同,PALS根据激活幅度动态调整每层的稀疏性比例。这种方法在LLaMA-2-7B的困惑度方面显示出显著的改进,取得了比统一剪枝方法更好的结果。然而,其益处依赖于架构,LLaMA-3-8B仅显示边际收益,而Mistral-7B则没有显示任何收益。
-
新的SVD-Surgeon方法无需重新训练即可优化LLM压缩
研究人员开发了SVD-Surgeon,一种新颖的、无需训练即可使用奇异值分解(SVD)压缩大型语言模型(LLM)的方法。该技术直接优化奇异值,提供一种封闭形式的更新,以补偿移除的组件并识别要修剪的值。当应用于现有的SVD压缩器(如SVD-LLM)时,SVD-Surgeon在不重新训练的情况下,提高了OPT和LLaMA 2-7B等模型的困惑度-压缩权衡。
-
新的 TaDA 算法使用深度感知门控来合并 LoRA 适配器
研究人员推出了一种新算法 TaDA,用于合并 Transformer 模型中特定任务和特定领域的 LoRA 适配器。与之前应用统一权重的方法不同,TaDA 利用了任务和领域信号之间观察到的深度依赖不对称性。该算法使用校准的探针引导门控进行每层加权和子空间感知合并,以有效地组合适配器组件。这种无需训练的方法会产生一个标准的 LoRA 适配器,没有推理开销,并在科学问答和图像分类基准测试中表现出卓越的性能。