PulseAugur
实时 20:54:08
实体 PaliGemma

PaliGemma

PulseAugur coverage of PaliGemma — every cluster mentioning PaliGemma across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
时间线
  1. 2026-08-03 product_launch Google released the PaliGemma model family, designed for fine-tuning in vision-language tasks. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_240557 ·

    Axis Robotics 推出基于浏览器的机器人操作研究数据库引擎

    Axis Robotics 推出了 AXIS,一个新颖的、基于浏览器的数据库引擎,旨在加速机器人操作研究。该系统允许通过 Web 界面进行连续数据收集,后端 GPU 负责处理训练和渲染等计算密集型任务。该数据集目前在 Hugging Face 上提供非商业学术用途,包含 207 个任务的 50,000 多条轨迹,通过程序化生成以确保多样性和可扩展性。初步结果表明,使用 AXIS 数据训练的模型在操作任务上的性能显著优于使用静态数据集训…

  2. TOOL · CL_199564 ·

    Pulumi 指导 Vertex AI 端点配置,支持自定义和预训练模型

    本文详细介绍了如何使用 Pulumi 配置 Vertex AI 端点,重点介绍了两种主要方法。第一种方法是使用 `gcp.vertex.AiEndpointWithModelGardenDeployment` 资源来部署 Model Garden 或 Hugging Face 中的模型,该资源同时处理端点创建和模型部署。第二种方法适用于自定义训练的模型,需要一个多步过程:使用 `gcp.vertex.AiEndpoint` 声明式地创…

  3. SIGNIFICANT · CL_179552 ·

    Google 发布 PaliGemma 视觉模型用于微调

    Google 发布了 PaliGemma 模型系列,这是一系列开源的视觉语言模型,专为微调而非通用聊天机器人使用而设计。这些模型结合了 Google 的 SigLIP 视觉编码器和 Gemma 语言解码器,有多种尺寸可供选择,参数量高达 270 亿。PaliGemma 针对单轮任务进行了优化,旨在通过微调适应特定应用,如视觉问答或光学字符识别,并可通过 Hugging Face Transformers 库进行集成。

  4. COMMENTARY · CL_155483 ·

    工程师构建自定义AI引擎,将幼儿发育与大型语言模型进行比较

    一位软件工程师从头开始构建了一个自定义的Transformer引擎,以理解Gemma和Llama等AI模型,并在他的CPU上运行它们。在此过程中,他观察到他的两个孩子在语言发展与AI行为之间存在相似之处。他指出,他女儿最初难以理解的言语与AI的“随机鹦鹉”描述形成对比,而他儿子突然表达的快乐则呼应了大型语言模型中讨论的涌现属性。

  5. TOOL · CL_123323 ·

    新的自适应检查点技术可大幅减少视觉模型微调的GPU内存占用

    研究人员开发了一种自适应检查点算法,以减少微调视觉模型和视觉语言模型(VLMs)所需的GPU内存。该方法在显存有限的消费级GPU上进行了测试,在可控的能耗开销下,显著降低了峰值内存使用量,最高可达79%。研究还比较了各种参数高效微调(PEFT)技术,发现QLoRA和BitFit在准确性略有下降的情况下能节省大量能源,而DINOv2等自监督模型在某些任务上的表现优于微调模型。

  6. TOOL · CL_48738 ·

    抖动技术提升视觉模型对抗鲁棒性

    研究人员开发了一种名为多级Floyd-Steinberg误差扩散抖动的新方法,以增强视觉基础模型的对抗鲁棒性。该技术作为一种输入转换,可以扰乱对抗性攻击,同时保持图像的语义内容。在各种任务和模型系列中进行测试,该抖动方法,特别是结合中间量化和后处理模糊,在干净输入上的退化较少的情况下,表现优于或媲美现有基线。

  7. FRONTIER RELEASE · CL_01234 ·

    阿里巴巴发布Qwen3.7-Plus多模态代理模型

    阿里巴巴的Qwen团队发布了Qwen3.7-Plus,这是一款旨在整合视觉和语言能力以实现多功能代理任务的新型多模态代理模型。此次发布是Hugging Face所强调的更广泛趋势的一部分,该趋势展示了多个新的视觉-语言模型和技术。该平台展示了Google的PaliGemma 2、Microsoft的Florence-2和Meta的Idefics2等方面的进展,以及对这些模型进行对齐和优化的方法。