两篇新研究论文介绍了QUASAR,一种用于提高量化大语言模型准确性的新方法。第一篇论文侧重于一种无需训练的训练后量化方法,该方法解决了残差补偿中的数值稳定性问题,并在Vision Transformer Base模型上取得了优异的成果。第二篇论文将QUASAR作为一种感知量化训练技术,通过将感知重构纳入训练循环来降低损失下限,在Qwen3和Llama-3.1等模型上显著提高了准确性和KL散度。 AI
影响 这些QUASAR方法通过在较低比特率下提高准确性,有可能在资源受限的设备上更有效地部署大语言模型。
排序理由 两篇介绍模型量化新方法的学术论文。
- arXiv
- Hugging Face
- Llama-3.1
- NVFP4
- Post Training Quantization Preprocessing Method of Convolutional Neural Network via Outlier Removal
- Quantization-Aware Training
- QUASAR
- Qwen3
- Vincent Counathe
- Vision Transformer Base
- W4A4
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →