实体
Xiao et al
Xiao et al
PulseAugur coverage of Xiao et al — every cluster mentioning Xiao et al across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
复现StreamingLLM产生零结果,凸显模型学习到的行为
一项试图复现大型语言模型StreamingLLM技术的尝试,该技术声称通过保留固定数量的初始token在KV缓存中来提高性能,但并未产生任何可辨别的影响。作者使用随机查询/键对进行的实验表明,当模型学习到的行为不存在时,StreamingLLM的所谓好处也随之消失。这表明StreamingLLM的有效性与其模型学习到的路由机制有关,而不是token位置的几何属性。
-
NanoQuant 实现支持低于 1 比特的模型量化
NanoQuant 方法的新实现支持对 Transformer 模型进行灵活的二值化量化,将模型大小减少到每权重低于 1 比特。该方法将矩阵分解为缩放向量和二值化矩阵,实现了显著的压缩。该实现基于 PyTorch 开发,已成功量化了 Qwen 模型,并旨在适应消费级硬件,尽管需要进行微调以获得最佳性能。