研究人员开发了AgentOCR,一个旨在降低大型语言模型(LLM)Agent历史相关的高昂token和内存成本的新颖框架。AgentOCR通过将Agent的交互历史转换为紧凑的图像来实现这一点,利用了视觉token卓越的信息密度。该系统包含分段光学缓存,以避免冗余的重新渲染,并采用Agentic自压缩,允许Agent自适应地平衡任务成功率和token效率。在ALFWorld和基于搜索的QA等基准上的实验表明,AgentOCR在保持文本基础Agent性能95%以上的同时,将token消耗量显著降低了50%以上。 AI
影响 降低了LLM Agent的计算成本,可能支持更复杂和更长期的Agent任务。
排序理由 该集群描述了一篇在arXiv上发表的研究论文,详细介绍了一个用于LLM Agent的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →