研究人员开发了一种使用大型语言模型(LLM)进行无损源代码压缩的新方法,该方法优于现有技术。这种称为阈值符号排序的方法将LLM的预测限制在排名靠前的符号,并将异常单独存储。对30个LLM的评估表明,该方法比以前的基于LLM的压缩器实现了高达37%的更好压缩率,并且速度快40%。虽然仍然比zstd等通用压缩器慢,但与它们相比,它提供了高达82%的显著改进的压缩增益,证明了LLM在捕捉源代码独特规律性方面的有效性。 AI
影响 为大规模代码存档提供了压缩率和速度之间新的权衡点,可能影响存储成本和数据传输效率。
排序理由 详细介绍使用LLM进行源代码压缩的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- bzip2
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- Scite
- Software Heritage
- Zstandard
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →