PulseAugur
实时 04:05:59
English(EN) LLM-based Source Code Compression via Thresholded Symbol Ranking

LLM在源代码压缩方面比通用工具好82%

研究人员开发了一种使用大型语言模型(LLM)进行无损源代码压缩的新方法,该方法优于现有技术。这种称为阈值符号排序的方法将LLM的预测限制在排名靠前的符号,并将异常单独存储。对30个LLM的评估表明,该方法比以前的基于LLM的压缩器实现了高达37%的更好压缩率,并且速度快40%。虽然仍然比zstd等通用压缩器慢,但与它们相比,它提供了高达82%的显著改进的压缩增益,证明了LLM在捕捉源代码独特规律性方面的有效性。 AI

影响 为大规模代码存档提供了压缩率和速度之间新的权衡点,可能影响存储成本和数据传输效率。

排序理由 详细介绍使用LLM进行源代码压缩的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM在源代码压缩方面比通用工具好82%

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Angelo Nardone, Paolo Ferragina ·

    基于LLM的阈值符号排序源代码压缩

    arXiv:2607.24192v1 Announce Type: cross Abstract: We study the problem of lossless compression of source code, motivated by the storage demands of large-scale software archives, such as Software Heritage (https://www.softwareheritage.org/). General-purpose compressors (e.g., zstd…