AQLM
PulseAugur coverage of AQLM — every cluster mentioning AQLM across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
研究发现:量化大语言模型展现出层依赖性个性
一项新的研究论文探讨了量化大语言模型(LLMs)的个性特征,超越了以往仅关注全精度模型的研究所。该研究引入了不确定性放大层解码(UALD)方法,以分析个性的出现如何跨越不同层级,以及量化如何影响这些特征。主要发现表明,虽然ENFJ个性类型在各种模型和精度中普遍存在,但极端的2位量化会破坏提示一致性和跨精度一致性,个性决策主要出现在模型的上层。
-
80B Qwen大语言模型通过高级压缩在4.3GB内存上运行
在边缘设备上运行大型语言模型的突破已通过Qwen 80B模型得到展示,据报道该模型仅使用了4.3GB内存即可运行。这一成就归功于先进的压缩技术,如混合精度和显著性感知压缩,它们能够识别并移除冗余的模型权重。进一步的优化包括分组权重共享、结构化剪枝和字典编码,从而减小了模型的有效大小。Apple的硬件,特别是其统一内存架构和支持稀疏张量的AMX-3协处理器,在实现这种高效的设备端推理方面发挥着至关重要的作用。
-
研究发现:量化对代码生成模型影响不同
一项新研究调查了各种量化方法对大型代码生成模型在资源受限硬件上运行时性能的影响。研究人员使用 Python 和 Java 基准测试,在 Qwen2.5-Coder 和 CodeLlama 模型上评估了包括 GPTQ、AWQ 和 AQLM 在内的六种最先进技术。研究结果表明,量化方法对代码的正确性和质量有显著且不同的影响,其中 AQLM 的表现与全精度模型相当,而 QuIP# 的性能下降最大。
-
新方法通过谱旋转大幅降低大模型量化比特宽度
研究人员开发了一种名为BBT-spectral的新方法,用于将大语言模型(LLM)量化到极低的比特宽度,特别是W2A16(2比特权重,16比特激活)。该技术利用受影响启发式谱旋转和重建误差量化器,显著降低了困惑度,在各种模型尺寸上比普通自动舍入量化性能高出15-58%。该方法已扩展到解决Qwen3和Qwen2.5等模型的特定架构挑战,证明了其在不同大模型家族中的适应性和有效性。