研究人员开发了ORCA(ORgan-Centroid Aggregation),一种用于压缩3D CT扫描视觉令牌的新颖方法。这种无需训练的方法通过器官引导合并相邻令牌,并结合质心空间编码以保留解剖信息。在相似的令牌预算下,ORCA的性能始终优于现有的压缩方法,显著减小了下游视觉语言模型的KV缓存大小和处理时间。ORCA的代码已在Hugging Face上发布。 AI
影响 使视觉语言模型能够更有效地处理3D医学成像数据,可能提高诊断准确性和报告生成。
排序理由 该集群包含一篇研究论文,详细介绍了用于AI模型视觉令牌压缩的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →