PulseAugur
中
实时 08:51:00
实体 SmolVLM2-2.2B

SmolVLM2-2.2B

PulseAugur coverage of SmolVLM2-2.2B — every cluster mentioning SmolVLM2-2.2B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_289438 ·

    ActionCodec 通过优化的动作分词技术推进 VLA 模型

    研究人员推出 ActionCodec,一种用于视觉-语言-动作 (VLA) 模型的新型动作分词方法。该方法侧重于优化 VLA 性能,而不仅仅是重建保真度,并确立了最大化时间分词重叠和最小化词汇冗余等设计原则。当应用于 SmolVLM2-2.2B 模型时,ActionCodec 在 LIBERO 基准测试上取得了 95.5% 的成功率,且无需先前的机器人训练,为 VLA 模型树立了新的最先进水平。

  2. RESEARCH · CL_235690 ·

    AI研究模仿人类视觉以实现高效视觉理解 · 2篇论文

    两篇新研究论文提出通过模仿人类中央凹视觉来更高效地进行视觉理解的方法。第一篇论文介绍了一种名为FAVE的可变分辨率ViT,它以高分辨率处理选定区域,同时保持原生几何结构,在物体识别和基于文本的视觉问答方面取得了改进,且计算资源显著减少。第二篇论文提出了一个数字中央凹管道,利用显著性驱动的注视和高分辨率观察,以传统密集预测方法一小部分的计算成本实现了实质性的语义理解。

  3. TOOL · CL_97866 ·

    Gemma 4 E2B 在工业边缘 AI 模型测试中领先于更快的竞争对手

    最近在 Jetson 设备上对五个小型多模态模型进行的工业边缘 AI 运行时测试发现,尽管 Gemma 4 E2B 不是最快的,但它仍然是基准模型。SmolVLM2 是最快的,但其输出过于泛泛。Qwen2.5-VL 表现强劲,尤其是在 OCR 和视觉检查任务中,使其成为一个有力的竞争者。InternVL3 在较高设置下存在上下文错误和延迟问题,而 Qwen2.5-Omni 更适合未来的音频/视频工作流。选择标准强调本地部署、结构化输出…