SigLIP-SO400M
PulseAugur coverage of SigLIP-SO400M — every cluster mentioning SigLIP-SO400M across labs, papers, and developer communities, ranked by signal.
-
发布新的西班牙语网络安全视觉语言模型
研究人员开发了VectraYX-Vision-1B,一个专为西班牙语和拉丁美洲网络安全图像设计的紧凑型视觉语言模型。该模型参数量小于20亿,集成了SigLIP-SO400M编码器和专用解码器,使其能够处理网络安全用户界面并以西班牙语响应。它通过原生标记和工具调用能力实现结构化视觉推理,并有可能通过llama.cpp的LLaVA格式进行隔离部署。初步测试显示在视觉基础方面存在挑战,但团队正在解决这些问题,并已发布代码、配置和模型权重,以…
-
新的西班牙语网络安全视觉语言模型显示出潜力,尽管存在基础问题
研究人员开发了VectraYX-Vision-1B,一个专为西班牙语和拉丁美洲网络安全图像设计的视觉语言模型。这个参数量小于20亿的模型集成了SigLIP编码器和西班牙语安全解码器,使其能够用西班牙语回答、生成结构化推理并调用工具。尽管功能管道已建立,初步结果显示视觉基础几乎为零,模型在很大程度上忽略了图像内容。研究团队正在调查补救策略,并探索与位置编码层相关的架构问题。
-
MAViE编码器将视觉语言模型效率提升80%
研究人员推出MAViE,一种多尺度自适应视觉编码器,旨在提高视觉语言模型的效率和有效性。MAViE利用位置依赖门控来整合来自视觉Transformer不同深度的特征,从而在保留全局语义的同时增强边缘和文本等局部细节的表示。该系统还采用问题条件令牌路由,根据图像复杂性和问题相关性来调整其令牌预算,显著减少处理的视觉令牌数量并提高推理速度。
-
研究发现,医学VLM基准存在预训练污染
研究人员审计了公共医学视觉-语言基准中是否存在预训练污染,发现在SLAKE-En基准上,SigLIP-B-16等模型存在可衡量的图像侧重叠。文本分析显示,Qwen2.5-VL在SLAKE-En上以及其他VLMs在OmniMedVQA上存在规范顺序可交换信号。然而,研究得出结论,某些检测方法(如队列相对尾部富集)对于小型医学VLM队列并不可靠。