PulseAugur
中
实时 19:15:33
实体 A10G

A10G

PulseAugur coverage of A10G — every cluster mentioning A10G across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_230239 ·

    SGLang推理引擎通过令牌级KV缓存提升LLM性能

    SGLang是一款新推出的开源AI推理引擎,旨在显著提升特定LLM工作负载的性能。它采用了一种新颖的RadixAttention机制,以令牌级别缓存KV缓存,从而提高了具有重复前缀(如代理循环和RAG)的应用程序的吞吐量。此外,SGLang将JSON模式编译成有限状态机,以实现更快的结构化输出生成。虽然vLLM在通用用例中仍具竞争力,但SGLang在前缀重用率高的场景中展示了高达5倍的显著加速。

  2. TOOL · CL_198162 ·

    研究发现:大语言模型词汇量应适应部署模式

    一篇新的研究论文提出,大语言模型(LLM)的最佳词汇量大小并非固定不变,而是取决于部署条件。该研究将总部署成本(包括训练和推理费用)形式化,并证明词汇量大小应根据批处理大小和推理量等因素进行调整。实验表明,对于单用户、设备端部署,较小的词汇量是最佳选择;而对于高吞吐量的数据中心服务,较大的词汇量更具成本效益,且对模型质量影响甚微。

  3. TOOL · CL_119075 ·

    LoRA和QLoRA:在消费级GPU上高效微调LLM

    本文深入探讨了参数高效微调(PEFT)方法,特别是LoRA和QLoRA,它们使得在单个消费级GPU上训练大型语言模型成为可能。文章解释了LoRA的数学原理,详细说明了它如何冻结预训练权重并引入可训练的低秩适配器矩阵。文章进一步阐述了QLoRA的创新,包括用于4位量化的NormalFloat 4数据类型和双量化,这些技术在不显著损失性能的情况下大大降低了内存需求。

  4. RESEARCH · CL_79592 ·

    AutoMegaKernel 将 Llama 模型编译为单个 CUDA 核函数

    研究人员开发了 AutoMegaKernel (AMK) 系统,该系统将 HuggingFace Llama 系列模型编译成单个、持久的 CUDA 核函数,以实现高效的前向传播。AMK 的静态验证器可确保调度安全,防止死锁和竞用条件。该系统支持从单一代码库支持多种 NVIDIA GPU 架构,并已展示出自我改进能力。