实体
A10G
A10G
PulseAugur coverage of A10G — every cluster mentioning A10G across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LoRA和QLoRA:在消费级GPU上高效微调LLM
本文深入探讨了参数高效微调(PEFT)方法,特别是LoRA和QLoRA,它们使得在单个消费级GPU上训练大型语言模型成为可能。文章解释了LoRA的数学原理,详细说明了它如何冻结预训练权重并引入可训练的低秩适配器矩阵。文章进一步阐述了QLoRA的创新,包括用于4位量化的NormalFloat 4数据类型和双量化,这些技术在不显著损失性能的情况下大大降低了内存需求。
-
AutoMegaKernel 将 Llama 模型编译为单个 CUDA 核函数
研究人员开发了 AutoMegaKernel (AMK) 系统,该系统将 HuggingFace Llama 系列模型编译成单个、持久的 CUDA 核函数,以实现高效的前向传播。AMK 的静态验证器可确保调度安全,防止死锁和竞用条件。该系统支持从单一代码库支持多种 NVIDIA GPU 架构,并已展示出自我改进能力。