实体
NOTCH4
NOTCH4
PulseAugur coverage of NOTCH4 — every cluster mentioning NOTCH4 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
嵌入表精度是减小LLM规模的关键
一项近期实验探索了量化对Transformer模型的影响,发现嵌入表占模型参数的很大一部分(72%)。研究发现,独立量化嵌入表,特别是使用逐行缩放,可以在性能损失极小的情况下大幅减少字节数。这种方法可以将模型尺寸减小6.2倍,同时通过将释放的字节重新分配给计数表和缓存来维持甚至提高系统级性能。
-
研究发现:大语言模型量化会膨胀推理Token使用量
一篇新的研究论文指出,尽管INT4和INT3等量化技术在降低大语言模型推理成本方面卓有成效,但它们可能会意外地膨胀推理Token的使用量。这种被称为“Token膨胀”的现象会抵消预期的加速效果,并带来隐藏的计算成本。该研究引入了“CoT Token膨胀率”来衡量这种效应,并提出量化感知训练可能是一种有前景的缓解策略。