PulseAugur
中
实时 08:12:05
实体 OneVision-Encoder

OneVision-Encoder

PulseAugur coverage of OneVision-Encoder — every cluster mentioning OneVision-Encoder across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_273331 ·

    CoVisco 视觉编码器使用原生令牌压缩进行长视频理解

    研究人员开发了 CoVisco,这是一种新颖的视觉编码器,旨在解决理解长视频的扩展限制。CoVisco 集成了编解码器原生输入和原生令牌压缩,使其能够一次性处理扩展的视觉序列,而无需形成密集的跨帧交互。该模型使用抽象令牌来维护视频级上下文,并且可以输出这些抽象令牌或抽象令牌与选定的块令牌的组合,以用于下游多模态大型语言模型 (MLLM)。在四段、64 帧的设置下进行测试时,CoVisco 使用的视觉令牌数量大大减少,性能与 OneVi…

  2. RESEARCH · CL_50757 ·

    LLaVA-OneVision-2 通过编解码流分词技术推动多模态AI发展

    研究人员开发了LLaVA-OneVision-2,这是一种新的视觉语言模型,通过采用编解码流分词和窗口注意力在多模态任务中表现出色。该模型将压缩视频作为连续比特成本流进行处理,从而实现自适应时间分组和高效空间证据选择。LLaVA-OneVision-2在JumpScore等基准测试中表现强劲,在视频理解、时间定位和跟踪方面显著优于Qwen3-VL-8B等模型。