PulseAugur
实时 08:36:49
English(EN) CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink框架提升MLLM代码理解效率

研究人员开发了CodeShrink,一个旨在提高多模态大语言模型(MLLMs)处理源代码效率的新框架。该系统包含三个关键组件:无空白渲染,用于消除来自空白符的token;自适应压缩配置,使用强化学习为每次输入优化设置;以及主导Token选择,用于修剪不相关的视觉token。评估表明,CodeShrink可以将视觉token使用量减少高达71.2%,同时在代码问答、克隆检测和代码补全等任务上保持或提高性能,优于现有的基于文本和视觉的压缩方法。 AI

影响 提高了处理代码的多模态模型的效率,可能降低成本并改善代码相关任务的性能。

排序理由 该集群包含一篇详细介绍多模态大语言模型新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

CodeShrink框架提升MLLM代码理解效率

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu ·

    CodeShrink:用于高效多模态代码理解的自适应视觉压缩

    arXiv:2607.29637v1 Announce Type: new Abstract: Rendering source code as images offers a promising way to reduce the input costs of Multimodal Large Language Models (MLLMs). Adjusting image resolution can trade visual token cost against content fidelity. However, resolution scali…