PulseAugur
实时 10:40:00
实体 Visual Tokens

Visual Tokens

PulseAugur coverage of Visual Tokens — every cluster mentioning Visual Tokens across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_242964 ·

    新的CoVeR方法为视觉语言模型(VLM)中的三维推理剪枝视觉令牌

    研究人员开发了CoVeR,一种在处理由多视角图像表示的三维场景时,用于剪枝视觉语言模型(VLM)中视觉令牌的新颖方法。该技术解决了使用多视角产生的冗余令牌问题,这可能导致计算成本高昂。CoVeR是一种确定性的、无需训练的选择器,它使用令牌坐标来确保场景的完整空间覆盖,同时遵守确切的令牌预算,克服了先前基于重要性或体素化方法的局限性。实验表明,CoVeR在三维推理基准测试中显著优于现有的最先进方法,在大幅减少令牌数量的同时实现了高性能。

  2. RESEARCH · CL_227216 ·

    新研究优化长视频多模态大语言模型的视觉标记处理

    研究人员正在探索优化多模态大语言模型(MLLMs)处理视觉信息的方法,尤其是在处理长视频方面。多篇论文介绍了用于选择、压缩和修剪视觉标记以提高效率和准确性的技术。一项研究强调,帧选择是最关键的因素,经典的算法如正交匹配追踪(Orthogonal Matching Pursuit)与新方法相比表现相当。其他方法则侧重于自适应标记化、基于注意力熵的秩保持修剪以及为持续学习动态生成标记。

  3. TOOL · CL_167170 ·

    新的MM-ShiftKV方法优化多模态LLM的KV缓存

    研究人员开发了MM-ShiftKV,一种用于优化多模态大语言模型(MLLM)中键值(KV)缓存的新颖方法。该技术解决了预填充阶段KV选择方法(基于预填充统计数据估算KV重要性)在多模态推理期间表现不佳的问题,因为解码时查询的方差很大。MM-ShiftKV是一种无需训练的方法,它通过使用方差扩展查询代理来近似预填充期间的解码时查询行为。然后,它根据聚合的注意力质量来估算提示KV的重要性,在严格的KV缓存预算下,在多模态基准测试中始终优于现有方法。

  4. TOOL · CL_93964 ·

    新AI框架增强6G网络面向任务的通信

    研究人员引入了一个名为ET-TokenCom的新框架,旨在改进AI原生6G网络中的面向任务的通信。该框架解决了任务导向型令牌的表示、视觉令牌与任务令牌的集成以及可解释性的增强等挑战。ET-TokenCom使用令牌作为信息表示和传输的统一单元,创建了从感知到推理的端到端通信链路。它从图像中提取视觉令牌,并引入来自基础模型的任务令牌来指导视觉数据的选择和传输,并在接收端具有可解释的输出机制。