一篇新论文对本地部署的大语言模型(LLMs)在消费级硬件上的能效进行了基准测试,结果表明,除了参数数量之外,模型架构和量化等因素也显著影响能耗。研究发现,qwen2.5:0.5b和tinyllama:1.1b等小型模型能效最高,而像7B-Mistral这样的大型模型每token消耗的功耗则要高得多。该研究还强调了区分不同token生成模式的重要性,因为有些模型由于内部推理时间过长而表现出异常高的能耗。 AI
影响 强调了本地部署大语言模型在模型大小、架构和能耗之间的权衡,为硬件和软件选择提供指导。
排序理由 该聚类包含一篇详细介绍大语言模型能效量化基准测试的研究论文。
- Docker
- graphics processing unit
- Hugging Face
- LLMs
- Mistral AI
- nvidia-smi
- Ollama
- Philipp Zähl
- qwen2.5:0.5b
- qwen3.5:0.8b(on)
- RTX 4060ti 16GB
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →