两篇新研究论文提出了压缩大型语言模型(LLM)的新颖方法,以减小其内存占用并提高效率。第一篇论文《LLM Compression by Block Removal with Constrained Binary Optimization》将LLM压缩构建为一个二元优化问题,在Llama-3.3-70B-Instruct的MMLU基准测试上取得了显著的提升。第二篇论文《UltraSketchLLM》引入了一种使用数据草图的低于1比特的压缩技术,该技术减少了峰值GPU内存,并在可容忍的性能下降的情况下提供了显著的加速。 AI
影响 这些压缩技术可以使强大的LLM在资源受限的硬件上部署,从而扩大可访问性和应用范围。
排序理由 该集群包含两篇详细介绍LLM压缩新颖方法的学术论文。
- GPU
- LLM
- Sunan Zou
- UltraSketchLLM
- AIME25
- GPQA
- Llama-3.1-8B-Instruct
- Llama-3.3-70B-Instruct
- MMLU
- NVIDIA-Nemotron-3-Nano-30B-A3B-FP8
- Qwen3-14B
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →