Llama-7B
PulseAugur coverage of Llama-7B — every cluster mentioning Llama-7B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新AI框架HADRec融合分子数据与EHR用于药物推荐
研究人员开发了HADRec,一个新颖的AI驱动药物推荐框架,通过整合分子知识和电子健康记录来解决当前方法的局限性。该框架使用LLaMA-7B处理临床笔记,使用ChemBERTa分析药物结构,从而能够更深入地理解患者状态和药物特征。HADRec还采用了一个层级预测器和一个一致性约束损失,以确保遵守解剖治疗化学(ATC)分类系统,并在MIMIC-III上展示了最先进的性能,在MIMIC-IV上表现出强大的泛化能力。
-
新研究为LLM提供先进的低秩压缩方案 · 追踪3个来源
三篇新研究论文介绍了使用低秩分解压缩大型语言模型(LLM)的先进技术。第一篇论文《Per-Matrix Optimality Is Not Enough》提出了一种三级优化策略,通过考虑Transformer块和整个模型,而不仅仅是单个矩阵,显著提高了困惑度。第二篇论文《UniRank》提出了一种统一的秩分配方法,根据局部能量和全局功能重要性对组件进行评分,实现了困惑度和准确度的显著提升。第三篇论文《MoARa》通过采用模块感知秩分配…
-
PCST 方法将 LLaMA-7B 模型压缩至 2.05 GiB,但质量有所下降
研究人员开发了 PCST(Product Code Structured Transform)方法,能够在无需重新训练的情况下将 LLaMA-7B 模型压缩至 2.05 GiB。尽管 PCST 实现了比 Q3_K_M 模型更小的文件大小,但在质量和运行时性能方面表现不佳。该项目探索了超过 60 种压缩技术,发现降低权重的均方误差(MSE)并未持续提高最终的 token 准确率。这项工作表明,未来的压缩努力应侧重于网络范围的表示和误差整…
-
SGLang推理引擎通过令牌级KV缓存提升LLM性能
SGLang是一款新推出的开源AI推理引擎,旨在显著提升特定LLM工作负载的性能。它采用了一种新颖的RadixAttention机制,以令牌级别缓存KV缓存,从而提高了具有重复前缀(如代理循环和RAG)的应用程序的吞吐量。此外,SGLang将JSON模式编译成有限状态机,以实现更快的结构化输出生成。虽然vLLM在通用用例中仍具竞争力,但SGLang在前缀重用率高的场景中展示了高达5倍的显著加速。
-
新的REP-LIE方法实现了Transformer模型的高效剪枝
研究人员开发了REP-LIE,一种用于Transformer模型高效剪枝的新颖方法。该方法使用LoRA低秩矩阵的梯度来估计权重的重要性,避免了计算完整梯度和预先微调的需要。REP-LIE包含一个用于迭代剪枝的稳定性得分,并使用轻量级更新进行微调,在LLaMA-7B和Mistral-7B等模型上表现出有竞争力。
-
新的REP-LIE方法实现了Transformer模型资源高效剪枝
研究人员开发了REP-LIE,一种在微调过程中高效剪枝Transformer模型的新方法。该方法使用LoRA低秩矩阵的梯度来估计权重重要性,避免了计算完整梯度和预先微调的需要。引入了稳定性分数来管理估计的随机性,从而可以迭代地剪枝不太重要的参数。在LLaMA-7B和Mistral-7B等模型上的实验表明,REP-LIE在显著降低资源消耗的同时,实现了具有竞争力的性能。
-
新的双流形几何方法增强深度学习表征
研究人员提出了一种新颖的双流形视角用于深度表征学习,重点关注网络参数内的几何结构。该方法提出了一种核引导特征变换(KGFT)模块,它利用卷积滤波器的几何结构来指导特征表征的演变。KGFT通过将几何信息从核流形传递到数据流形,显式地重塑特征关系,从而在不施加过多约束的情况下增强表征学习。在ResNet、ViT和LLaMA-7B等各种架构上的实验表明,在图像分类和算术推理任务上取得了持续的改进,证明了该方法的通用性和有效性。
-
开源 LLM Agent 易受对抗性攻击导致财务损失
管理大量金融资产的 LLM Agent 由于依赖 LLaMA 和 Mistral AI 等开源模型,容易受到基于梯度的对抗性攻击。攻击者可以下载模型权重并构造特定的、看起来无意义的文本后缀,当 LLM 处理这些后缀时,会触发意外操作,例如执行欺诈性交易。最初涉及在模型权重中添加随机噪声的防御尝试已被证明无效,因为攻击者可以平均化噪声以优化基础模型。目前正在探索更高级的防御措施,包括依赖输入的噪声生成。
-
新的TriSP方法在保持性能的同时显著剪枝LLM
研究人员开发了TriSP,一种用于大型语言模型的新型结构化剪枝方法,旨在降低其计算和内存成本。TriSP结合了权重幅度、激活范数和梯度敏感性,以创建通道级重要性得分。当与自适应层预算分配和LoRA恢复配对时,TriSP在LLaMA-7B模型上表现出卓越的性能,实现了更低的困惑度和更高的准确性,同时显著提高了推理吞吐量。
-
新的LLM压缩技术利用了先进的数学和图像适应性
研究人员正在开发先进的大型语言模型(LLM)压缩技术,以降低其计算和存储需求。一篇论文介绍了Leech Lattice Vector Quantization (LLVQ),该技术利用高维格进行最优球体打包,以实现最先进的压缩性能。另一种方法LACE-SVD使用有损奇异值分解和累积误差校正,在保持模型精度的同时提高压缩率。对于图像压缩,LUMI框架提供了一种与分词器无关的方法,使用冻结的LLM骨干网络,将像素数据适应LLM的嵌入空间,…
-
新研究探索非线性缩放和几何优化以实现高效LLM训练
两篇新研究论文探讨了更高效训练大型语言模型(LLM)的方法。第一篇论文《关于LLM训练学习率缩放的非线性研究》调查了当前学习率外推法的局限性,并提出最优学习率在更大规模下呈现向上曲率,这可以通过关注有效学习率或数据外推来缓解。第二篇论文《面向高效LLM训练的几何原理随机优化》引入了新算法GrassWalk和GrassJump,它们利用梯度子空间的几何特性来提高优化效率,在LLaMA和Qwen等模型上取得了最先进的成果。
-
Jetson Orin NX 为 Hermes Agent 提供 65K 上下文和快速推理能力
一位用户已成功配置 Jetson Orin NX 以运行 Hermes Agent,并取得了令人印象深刻的性能指标。该配置优先考虑静音和美观,同时在文本生成方面实现了超过 10 token/秒,在提示处理方面实现了 300 token/秒。该设置支持至少 65,000 token 的上下文窗口,具体测试显示 Gemma 4 26B 模型在 60,000 token 上下文下实现了 10.21 token/秒。
-
新框架通过建模任务关系优化大型语言模型微调
研究人员开发了一个名为TaskPGM的新框架,用于优化大型语言模型的微调过程。该方法使用基于能量的任务模型,将任务表示为马尔可夫随机场,以捕捉任务间的关系和效用。通过平衡覆盖率与冗余度,TaskPGM改进了标准的混合策略,并提供了对任务交互的可解释见解,在LLaMA-7B和Qwen2-7B等模型上展示了增强的性能。
-
GenFT 方法增强基础模型微调
研究人员推出了一种新颖的预训练基础模型参数高效微调方法 GenFT。GenFT 利用基于模型现有权重生成的确定性权重生成器来产生任务特定的更新。该方法通过带有非线性激活的行和列变换从预训练权重中提取结构化模式,旨在提高在自然语言处理和计算机视觉的各种基准测试中的性能。
-
FlashNorm 加速 Transformer 推理,优化归一化层
研究人员开发了 FlashNorm 技术,用于加速 Transformer 模型中的归一化层。通过重构 RMSNorm 并将其权重折叠到后续的线性层中,FlashNorm 实现了归一化和矩阵乘法的并行执行,从而降低了延迟。该方法还可以消除 Gemma 和 DeepSeek-V2 等架构中的预注意力 RMSNorm 层,简化实现并减少参数数量。