PulseAugur
中
实时 00:41:00
实体 llama2-7b

llama2-7b

PulseAugur coverage of llama2-7b — every cluster mentioning llama2-7b across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_244807 ·

    新型适配器增强大语言模型的多模态情绪识别能力

    研究人员开发了MVFA,这是一种新颖的适配器,旨在增强冻结的大语言模型(LLMs)在多模态情感计算任务(如情感分析和情绪识别)中的能力。该参数高效框架利用互补的文本视图来指导与音频和视觉特征的跨模态融合,并将融合后的表示压缩成伪标记。MVFA在CH-SIMS V2.0、MELD和CHERMA等数据集上展示了最先进的性能,同时仅更新了少量参数。

  2. RESEARCH · CL_227270 ·

    新方法增强LoRA在模型适应中的效率和稳定性

    研究人员开发了两种新方法来提高参数高效模型适应中使用的低秩适应(LoRA)技术的效率和稳定性。归一化低秩适应(NoRA)在训练期间对降维矩阵进行归一化,以加速收敛并提高性能,而无需增加参数或计算开销。LoRA的激活边界匹配(ABM-LoRA)使用任务诱导的激活边界符号作为新适配器的目标,提高了LoRA对初始化的敏感度,并在各种基准测试中优于标准LoRA。

  3. RESEARCH · CL_216016 ·

    新研究探讨 RAG 的可靠性、效用和幻觉风险 · 追踪 8 个来源

    近期研究探讨了检索增强生成 (RAG) 系统的细微差别,重点关注提高其可靠性和效用。一篇论文详细介绍了一个用于 LLMs4OL 2026 挑战的系统,该系统使用 Qwen2.5-14B-Instruct 进行检索增强的少样本提示,在本体学习任务上取得了优异的成绩,但突出了关系提取方面的局限性。另一项研究调查了证据感知检索评估(优先考虑支持生成的段落)是否能真正提高下游效用,发现结果好坏参半,并建议应根据具体用例定制评估方法。进一步的研…

  4. TOOL · CL_206259 ·

    新的LoRA-CRAFT方法大幅减少微调参数

    研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。

  5. TOOL · CL_160816 ·

    新方法在扩展上下文窗口后恢复LLM性能

    研究人员开发了LinearARD,一种新颖的自蒸馏方法,旨在恢复大型语言模型(LLM)在扩展上下文窗口后的性能。该技术侧重于对齐学生模型和教师模型之间的注意力动态,而不仅仅是匹配隐藏状态。通过使用线性内存核来高效管理注意力图,LinearARD显著减少了所需的训练token数量,在实现长上下文能力提升的同时,达到了原始短文本性能的98.3%。

  6. RESEARCH · CL_139540 ·

    新的大语言模型研究涵盖多模态对齐、推理审计和能源使用 · 已追踪 10 个来源

    近期研究探讨了大语言模型(LLM)能力和局限性的各个方面。一项研究调查了多模态大语言模型的对齐问题,提出了一种新的数据生成方法来提高图像-文本一致性。另一篇论文介绍了一种用于评估大语言模型推理的协议级审计,突出了基准分数与实际行为属性之间的差异。进一步的研究利用围棋死活题探究了大语言模型的推理效率,揭示了当前模型在搜索组织方面存在困难。此外,还有研究考察了大语言模型的能耗、默认设置和代币定价对推理服务的影响,以及低资源编程语言基准的开发。

  7. RESEARCH · CL_128867 ·

    LLAMA2 7B 模型适配电子商务赞助搜索,超越 GPT-4

    研究人员通过使用低秩适配 (LoRA) 技术适配 LLAMA2 7B 模型,开发了一个先进的电子商务赞助搜索广告相关性模型。该微调模型在广告相关性分类中达到了 89.43% 的准确率,优于基线模型和 GPT-4。此次适配提高了搜索精度、运营效率和隐私性,为在线市场带来了显著改进。

  8. TOOL · CL_79161 ·

    研究人员详述 Transformer 语言模型中的反分词过程

    研究人员详述了 Transformer 语言模型(其操作基于子词片段)如何将这些片段聚合为词语级别表示的过程。他们识别出一个主要发生在早期到中期层的两阶段反分词过程,涉及注意力机制传递特定于标记的信号,以及多层感知机(MLP)将这些信号与局部嵌入进行组合。该机制在八个不同家族的十二个模型中均被发现是一致的,其过程的深度因位置编码类型的不同而异。

  9. TOOL · CL_72695 ·

    单个LLM层主导零阶微调

    研究人员发现,在使用零阶(ZO)优化时,微调大型语言模型(LLM)的单个层与微调整个模型一样有效。通过在训练前分析激活值异常值来识别出的这个主导层,在各种任务和模型系列中,其效果始终能媲美甚至超越全模型ZO微调。主导层的有效性源于其高扰动敏感性和在残差流中的早期位置,这使得优化信号能够高效传播。该方法显著加快了速度,实验显示训练速度提高了4.52倍,同时保持或提高了性能。

  10. COMMENTARY · CL_25028 ·

    GPU显存带宽对本地LLM速度至关重要,超越VRAM

    对于在本地运行大型语言模型而言,GPU显存带宽比VRAM容量更为关键。更高的带宽使GPU能够更快地处理数据,防止其因等待VRAM信息而成为瓶颈。这种差异可以显著提高令牌生成速度,一些显卡仅凭带宽差异就能实现双倍性能,即使计算规格相似。

  11. RESEARCH · CL_16287 ·

    先压缩再适配?不,通过任务感知子空间联合进行

    研究人员推出了一种名为 JACTUS 的新框架,该框架将参数高效微调 (PEFT) 和低秩压缩统一起来,用于适配大型预训练模型。与顺序方法不同,JACTUS 通过形成子空间的正交联合并执行投影低秩近似来联合优化压缩和适配。这种方法旨在防止压缩子空间与下游目标之间的失配,从而实现更高效、更鲁棒的模型调整。