algorithmic information theory
PulseAugur coverage of algorithmic information theory — every cluster mentioning algorithmic information theory across labs, papers, and developer communities, ranked by signal.
-
新的几何编码定理统一了算法信息论与群论
本文是计算算法统计(CAS)系列的第一篇,重点介绍了一个几何编码定理。它在对称群的背景下建立了经典编码定理的类似物,为字符串定义了一个“对称先验”。该研究统一了算法信息论与群论,为复杂性度量提供了新的视角。
-
基于AIT的新方法在文本分类任务上超越BERT
研究人员开发了一种基于算法信息论(AIT)分析文本结构的新方法,利用Ladderpath方法识别序列中的嵌套和分层重复。该方法定义了三种新的距离度量,当与k近邻分类器集成时,在文本分类任务(包括分布外和少样本场景)中表现出色。这些Ladderpath派生的距离在这些具有挑战性的环境中优于基于gzip的归一化压缩距离(NCD)和BERT,为序列理解提供了一种轻量级、可解释且无需训练的替代方案。
-
新的ladderpath指数通过模式重用衡量语言复杂度
研究人员开发了一种名为ladderpath指数的新指标来衡量语言复杂度。该指数量化了通过重用重复子结构来重建序列所需的步骤,借鉴了算法信息论。当应用于21个平行语料库时,ladderpath指数在不同语言之间表现出惊人的一致性,表明存在一个普遍的复杂度水平。研究结果还表明不同语言层面(如字符集和词汇量)之间存在权衡,支持总复杂度守恒的观点。
-
AI 模型是压缩引擎,而非记忆设备
AI 模型作为复杂的压缩引擎运行,将大量的训练数据压缩成固定大小的参数向量。这个过程根植于算法信息论,迫使模型发现潜在的模式和结构,而不是简单地记忆数据。因此,虽然这些模型拥有广泛的知识,但它们缺乏对过去交互或用户提供细节的具体回忆,因为这些信息被视为噪声并被压缩掉了。AI 模型的有效性直接与其压缩能力挂钩,更大的模型通过捕捉更复杂的模式来实现更好的性能。