PulseAugur
实时 07:34:07
实体 Llama-7B

Llama-7B

PulseAugur coverage of Llama-7B — every cluster mentioning Llama-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_200236 ·

    新的双流形几何方法增强深度学习表征

    研究人员提出了一种新颖的双流形视角用于深度表征学习,重点关注网络参数内的几何结构。该方法提出了一种核引导特征变换(KGFT)模块,它利用卷积滤波器的几何结构来指导特征表征的演变。KGFT通过将几何信息从核流形传递到数据流形,显式地重塑特征关系,从而在不施加过多约束的情况下增强表征学习。在ResNet、ViT和LLaMA-7B等各种架构上的实验表明,在图像分类和算术推理任务上取得了持续的改进,证明了该方法的通用性和有效性。

  2. TOOL · CL_170929 ·

    开源 LLM Agent 易受对抗性攻击导致财务损失

    管理大量金融资产的 LLM Agent 由于依赖 LLaMA 和 Mistral AI 等开源模型,容易受到基于梯度的对抗性攻击。攻击者可以下载模型权重并构造特定的、看起来无意义的文本后缀,当 LLM 处理这些后缀时,会触发意外操作,例如执行欺诈性交易。最初涉及在模型权重中添加随机噪声的防御尝试已被证明无效,因为攻击者可以平均化噪声以优化基础模型。目前正在探索更高级的防御措施,包括依赖输入的噪声生成。

  3. TOOL · CL_167171 ·

    新的TriSP方法在保持性能的同时显著剪枝LLM

    研究人员开发了TriSP,一种用于大型语言模型的新型结构化剪枝方法,旨在降低其计算和内存成本。TriSP结合了权重幅度、激活范数和梯度敏感性,以创建通道级重要性得分。当与自适应层预算分配和LoRA恢复配对时,TriSP在LLaMA-7B模型上表现出卓越的性能,实现了更低的困惑度和更高的准确性,同时显著提高了推理吞吐量。

  4. RESEARCH · CL_128786 ·

    新的LLM压缩技术利用了先进的数学和图像适应性

    研究人员正在开发先进的大型语言模型(LLM)压缩技术,以降低其计算和存储需求。一篇论文介绍了Leech Lattice Vector Quantization (LLVQ),该技术利用高维格进行最优球体打包,以实现最先进的压缩性能。另一种方法LACE-SVD使用有损奇异值分解和累积误差校正,在保持模型精度的同时提高压缩率。对于图像压缩,LUMI框架提供了一种与分词器无关的方法,使用冻结的LLM骨干网络,将像素数据适应LLM的嵌入空间,…

  5. RESEARCH · CL_117616 ·

    新研究探索非线性缩放和几何优化以实现高效LLM训练

    两篇新研究论文探讨了更高效训练大型语言模型(LLM)的方法。第一篇论文《关于LLM训练学习率缩放的非线性研究》调查了当前学习率外推法的局限性,并提出最优学习率在更大规模下呈现向上曲率,这可以通过关注有效学习率或数据外推来缓解。第二篇论文《面向高效LLM训练的几何原理随机优化》引入了新算法GrassWalk和GrassJump,它们利用梯度子空间的几何特性来提高优化效率,在LLaMA和Qwen等模型上取得了最先进的成果。

  6. TOOL · CL_80801 ·

    Jetson Orin NX 为 Hermes Agent 提供 65K 上下文和快速推理能力

    一位用户已成功配置 Jetson Orin NX 以运行 Hermes Agent,并取得了令人印象深刻的性能指标。该配置优先考虑静音和美观,同时在文本生成方面实现了超过 10 token/秒,在提示处理方面实现了 300 token/秒。该设置支持至少 65,000 token 的上下文窗口,具体测试显示 Gemma 4 26B 模型在 60,000 token 上下文下实现了 10.21 token/秒。

  7. TOOL · CL_72742 ·

    新框架通过建模任务关系优化大型语言模型微调

    研究人员开发了一个名为TaskPGM的新框架,用于优化大型语言模型的微调过程。该方法使用基于能量的任务模型,将任务表示为马尔可夫随机场,以捕捉任务间的关系和效用。通过平衡覆盖率与冗余度,TaskPGM改进了标准的混合策略,并提供了对任务交互的可解释见解,在LLaMA-7B和Qwen2-7B等模型上展示了增强的性能。

  8. TOOL · CL_72741 ·

    GenFT 方法增强基础模型微调

    研究人员推出了一种新颖的预训练基础模型参数高效微调方法 GenFT。GenFT 利用基于模型现有权重生成的确定性权重生成器来产生任务特定的更新。该方法通过带有非线性激活的行和列变换从预训练权重中提取结构化模式,旨在提高在自然语言处理和计算机视觉的各种基准测试中的性能。

  9. RESEARCH · CL_06849 ·

    FlashNorm 加速 Transformer 推理,优化归一化层

    研究人员开发了 FlashNorm 技术,用于加速 Transformer 模型中的归一化层。通过重构 RMSNorm 并将其权重折叠到后续的线性层中,FlashNorm 实现了归一化和矩阵乘法的并行执行,从而降低了延迟。该方法还可以消除 Gemma 和 DeepSeek-V2 等架构中的预注意力 RMSNorm 层,简化实现并减少参数数量。