PaliGemma
PulseAugur coverage of PaliGemma — every cluster mentioning PaliGemma across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
工程师构建自定义AI引擎,将幼儿发育与大型语言模型进行比较
一位软件工程师从头开始构建了一个自定义的Transformer引擎,以理解Gemma和Llama等AI模型,并在他的CPU上运行它们。在此过程中,他观察到他的两个孩子在语言发展与AI行为之间存在相似之处。他指出,他女儿最初难以理解的言语与AI的“随机鹦鹉”描述形成对比,而他儿子突然表达的快乐则呼应了大型语言模型中讨论的涌现属性。
-
新的自适应检查点技术可大幅减少视觉模型微调的GPU内存占用
研究人员开发了一种自适应检查点算法,以减少微调视觉模型和视觉语言模型(VLMs)所需的GPU内存。该方法在显存有限的消费级GPU上进行了测试,在可控的能耗开销下,显著降低了峰值内存使用量,最高可达79%。研究还比较了各种参数高效微调(PEFT)技术,发现QLoRA和BitFit在准确性略有下降的情况下能节省大量能源,而DINOv2等自监督模型在某些任务上的表现优于微调模型。
-
抖动技术提升视觉模型对抗鲁棒性
研究人员开发了一种名为多级Floyd-Steinberg误差扩散抖动的新方法,以增强视觉基础模型的对抗鲁棒性。该技术作为一种输入转换,可以扰乱对抗性攻击,同时保持图像的语义内容。在各种任务和模型系列中进行测试,该抖动方法,特别是结合中间量化和后处理模糊,在干净输入上的退化较少的情况下,表现优于或媲美现有基线。
-
阿里巴巴发布Qwen3.7-Plus多模态代理模型
阿里巴巴的Qwen团队发布了Qwen3.7-Plus,这是一款旨在整合视觉和语言能力以实现多功能代理任务的新型多模态代理模型。此次发布是Hugging Face所强调的更广泛趋势的一部分,该趋势展示了多个新的视觉-语言模型和技术。该平台展示了Google的PaliGemma 2、Microsoft的Florence-2和Meta的Idefics2等方面的进展,以及对这些模型进行对齐和优化的方法。