llama2-7b
PulseAugur coverage of llama2-7b — every cluster mentioning llama2-7b across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
SKILL-RAG论文介绍用于RAG系统的自我知识过滤
一篇新研究论文介绍了一种名为SKILL-RAG的方法,该方法旨在通过利用语言模型的自我知识来改进检索增强生成(RAG)。这种方法旨在过滤掉不相关的检索内容,而这通常会导致RAG系统产生幻觉。SKILL-RAG使用强化学习框架来引发模型对其自身知识的理解,并应用句子级过滤,只保留有益的信息。使用Llama2-7B和Qwen3-8B模型进行的实验表明,SKILL-RAG提高了生成质量并减少了处理的文档数量。
-
新的LoRA-CRAFT方法大幅减少微调参数
研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。
-
新方法在扩展上下文窗口后恢复LLM性能
研究人员开发了LinearARD,一种新颖的自蒸馏方法,旨在恢复大型语言模型(LLM)在扩展上下文窗口后的性能。该技术侧重于对齐学生模型和教师模型之间的注意力动态,而不仅仅是匹配隐藏状态。通过使用线性内存核来高效管理注意力图,LinearARD显著减少了所需的训练token数量,在实现长上下文能力提升的同时,达到了原始短文本性能的98.3%。
-
新的大语言模型研究涵盖多模态对齐、推理审计和能源使用 · 已追踪 10 个来源
近期研究探讨了大语言模型(LLM)能力和局限性的各个方面。一项研究调查了多模态大语言模型的对齐问题,提出了一种新的数据生成方法来提高图像-文本一致性。另一篇论文介绍了一种用于评估大语言模型推理的协议级审计,突出了基准分数与实际行为属性之间的差异。进一步的研究利用围棋死活题探究了大语言模型的推理效率,揭示了当前模型在搜索组织方面存在困难。此外,还有研究考察了大语言模型的能耗、默认设置和代币定价对推理服务的影响,以及低资源编程语言基准的开发。
-
LLAMA2 7B 模型适配电子商务赞助搜索,超越 GPT-4
研究人员通过使用低秩适配 (LoRA) 技术适配 LLAMA2 7B 模型,开发了一个先进的电子商务赞助搜索广告相关性模型。该微调模型在广告相关性分类中达到了 89.43% 的准确率,优于基线模型和 GPT-4。此次适配提高了搜索精度、运营效率和隐私性,为在线市场带来了显著改进。
-
研究人员详述 Transformer 语言模型中的反分词过程
研究人员详述了 Transformer 语言模型(其操作基于子词片段)如何将这些片段聚合为词语级别表示的过程。他们识别出一个主要发生在早期到中期层的两阶段反分词过程,涉及注意力机制传递特定于标记的信号,以及多层感知机(MLP)将这些信号与局部嵌入进行组合。该机制在八个不同家族的十二个模型中均被发现是一致的,其过程的深度因位置编码类型的不同而异。
-
单个LLM层主导零阶微调
研究人员发现,在使用零阶(ZO)优化时,微调大型语言模型(LLM)的单个层与微调整个模型一样有效。通过在训练前分析激活值异常值来识别出的这个主导层,在各种任务和模型系列中,其效果始终能媲美甚至超越全模型ZO微调。主导层的有效性源于其高扰动敏感性和在残差流中的早期位置,这使得优化信号能够高效传播。该方法显著加快了速度,实验显示训练速度提高了4.52倍,同时保持或提高了性能。
-
GPU显存带宽对本地LLM速度至关重要,超越VRAM
对于在本地运行大型语言模型而言,GPU显存带宽比VRAM容量更为关键。更高的带宽使GPU能够更快地处理数据,防止其因等待VRAM信息而成为瓶颈。这种差异可以显著提高令牌生成速度,一些显卡仅凭带宽差异就能实现双倍性能,即使计算规格相似。
-
先压缩再适配?不,通过任务感知子空间联合进行
研究人员推出了一种名为 JACTUS 的新框架,该框架将参数高效微调 (PEFT) 和低秩压缩统一起来,用于适配大型预训练模型。与顺序方法不同,JACTUS 通过形成子空间的正交联合并执行投影低秩近似来联合优化压缩和适配。这种方法旨在防止压缩子空间与下游目标之间的失配,从而实现更高效、更鲁棒的模型调整。