PulseAugur
实时 15:16:05
实体 attention kernel type

attention kernel type

PulseAugur coverage of attention kernel type — every cluster mentioning attention kernel type across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_139217 ·

    vLLM 配置影响 LLM 的能耗、性能和准确性

    一篇新的研究论文探讨了在为大型语言模型 (LLM) 配置 vLLM 等推理引擎时,能耗、性能和准确性之间的权衡。该研究分析了五种开源 LLM 和五种推理任务中,注意力核类型、前缀缓存和分块预填充的组合。结果表明,注意力类型和前缀缓存对能耗和性能有显著影响,其影响因模型和工作负载而异,而在默认配置下,分块预填充的影响有限。研究还发现,推理引擎的选择可能会意外地影响模型的准确性。