GZIP
PulseAugur coverage of GZIP — every cluster mentioning GZIP across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Diffusion LMs 推动无损文本压缩,超越 LLMs 和 zstd
研究人员引入了扩散语言模型(DLMs)作为无损文本压缩的新方法,旨在克服现有自回归 LLM 方法的吞吐量限制。该新框架在最近的 arXiv 论文中进行了详细介绍,通过解决符号编码决策的相关挑战来适应 DLMs 进行压缩。在 enwik8 基准测试上的实验结果表明,基于 DLM 的框架实现了最先进的压缩比,超越了 zstd 和 gzip 等传统压缩器,并且性能优于之前的基于 LLM 的压缩技术。
-
数据压缩与大型语言模型共享核心预测原理
文章探讨了数据压缩技术与大型语言模型(LLMs)底层原理之间的根本联系。它解释了诸如最小化和行程长度编码等方法如何通过消除冗余或更有效地表示重复模式来减小数据大小。现代压缩工具利用变换、模型(根据符号频率描述数据形状)和熵编码器来实现显著的数据缩减,这一过程类似于大型语言模型如何学习预测和表示信息。
-
Brevis系统为无损张量压缩合成程序
研究人员开发了Brevis,一个将无损张量压缩视为程序合成问题的创新系统。Brevis利用具有可逆运算符的领域特定语言(DSL)来捕获张量结构,从而能够合成紧凑的、可执行的重构程序。该方法在10个大型模型检查点上实现了33.93%的存储空间缩减,优于Zstandard和GZIP等通用压缩器以及ZipNN和DFloat11等张量特定方法。Brevis还展示了高速的压缩和解压缩速率,同时确保了比特精确重构。
-
玩家使用自定义格式将 80TB Minecraft 服务器地图压缩至 15TB · 已追踪 2 个来源
一群 Minecraft 玩家成功地映射并压缩了该游戏最古老的无政府服务器 2b2t 的 80TB 数据,并将其压缩至 15TB 下载。这项名为 2b2tplace 的纪念性保存工作耗时 22 个月,动用了 28 个机器人账户来映射所有三个 Minecraft 维度中的一百万多个方块。为了实现这一目标,该团队开发了一种名为 .zvcr 的自定义压缩格式,该格式利用 Zstandard 算法,与标准的 Minecraft 格式相比,压缩率更高。
-
无参数稀疏注意力通过数据压缩实现效率提升
研究人员开发了一种新颖的、无需参数的自适应稀疏注意力方法,用于 Transformer 模型,利用数据压缩技术动态选择长程注意力相关的关键内容块。该方法借鉴了 GZIP 等经典压缩算法的思路,识别信息丰富且不易压缩的片段,从而在不增加可学习参数或专用硬件的情况下提高注意力效率。在 PG-19 数据集上的实验表明,与固定注意力模式和其他自适应方法相比,该方法在逐字节语言建模性能上有了显著提升,收敛速度更快,并且在处理长序列时具有更好的可扩展性。
-
基于AIT的新方法在文本分类任务上超越BERT
研究人员开发了一种基于算法信息论(AIT)分析文本结构的新方法,利用Ladderpath方法识别序列中的嵌套和分层重复。该方法定义了三种新的距离度量,当与k近邻分类器集成时,在文本分类任务(包括分布外和少样本场景)中表现出色。这些Ladderpath派生的距离在这些具有挑战性的环境中优于基于gzip的归一化压缩距离(NCD)和BERT,为序列理解提供了一种轻量级、可解释且无需训练的替代方案。
-
GZIP压缩算法被探索为语言模型
一篇博文探讨了使用GZIP压缩算法作为语言模型的概念,将压缩与预测进行类比。作者演示了通过预先输入文本语料库,GZIP可以生成具有一定连贯性(尽管不完美)的续写。这是通过利用DEFLATE算法的字节匹配机制实现的,其中可预测的序列会压缩成更少的字节,从而有效地充当概率模型。
-
LLM实现通过熵编码的实时文本传输
研究人员探索了使用基于LLM的熵编码进行实时文本传输的学习、预测和压缩之间的联系。他们分析了在固定速率信道上,当因果语言模型预测符号进行编码时,压缩效率与传输延迟之间的权衡。该研究比较了包括霍夫曼编码、算术编码和rANS在内的各种编码方案,发现霍夫曼编码由于其零算法延迟,适用于过度配置的信道,而算术编码则以延迟为代价提供更好的压缩效果。这些发现通过从GPT-2 (124M)到Llama 3.2 (3B)的模型进行了验证,表明更大的模型…