研究人员开发了EFQ-Softmax,一种用于Transformer模型低比特量化的新颖方法,它绕过了Softmax的传统指数计算。该方法直接将移位的注意力分数映射到E2M1操作数,在不牺牲模型质量的情况下优化效率。在Qwen3-8B和Qwen3-VL-8B-Instruct等模型上的评估显示性能指标有所提高,并且在A5向量单元上的内核级测试证明延迟显著降低。 AI
影响 该方法可以实现更高效的大型语言模型在精度能力有限的硬件上的部署。
排序理由 该集群描述了一种优化Transformer模型的新方法,该方法在一篇研究论文中有详细介绍。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- A5 motorway
- EFQ-Softmax
- Flashattention
- MXFP4
- Qwen3-8B
- Qwen3-VL-8B-Instruct
- Transformer++
- VBench
- WAN2.2-TI2V-5B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →