PulseAugur
实时 18:30:37
实体 TechVerse Enclave

TechVerse Enclave

PulseAugur coverage of TechVerse Enclave — every cluster mentioning TechVerse Enclave across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_238711 ·

    QLoRA 微调:揭示 LLM 的关键超参数

    GenAI 工程师 Pranjul Rathour 分享了优化 QLoRA 超参数以微调大型语言模型 (LLM) 的见解。他强调,秩 (r) 和 alpha 对于适配器容量和扩展至关重要,建议大多数任务的 r=8-16,复杂任务可高达 64,alpha 通常设置为 2*r。Rathour 还建议包含 MLP 层以及注意力投影以获得更好的结果,并建议学习率在 1e-4 到 2e-4 之间,并进行短暂预热。轮次数量应根据数据集大小进行调整…

  2. TOOL · CL_238712 ·

    LoRA vs QLoRA vs 全量微调:选择正确的LLM方法

    文章比较了三种微调大型语言模型的方法:全量微调、LoRA 和 QLoRA。全量微调会更新所有模型参数,需要大量的硬件资源,这对于学生来说不切实际。LoRA 冻结基础权重并训练小的适配器矩阵,大大减少了内存需求。QLoRA 通过使用带有 LoRA 适配器的 4 位量化基础模型进一步优化了这一点,使得在消费级 GPU 上微调 Qwen3-1.7B 等模型成为可能。选择这些方法主要取决于可用的硬件和期望的结果,数据集质量是成功的关键因素。