PulseAugur
中
实时 21:40:18
实体 Open Clip Art Library

Open Clip Art Library

PulseAugur coverage of Open Clip Art Library — every cluster mentioning Open Clip Art Library across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
14
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_284843 ·

    UniCounting 解决了无图像查询的多类别视觉计数问题

    研究人员推出了一种新颖的无图像查询多类别视觉计数方法 UniCounting。与专注于具有特定示例的单类别计数方法不同,UniCounting 仅凭 RGB 图像即可预测完整的类别-计数向量,并使用固定的全局词汇表。该系统利用 SAM 2.1 等通用分割器生成掩码,并利用 DINOv2 和 OpenCLIP 进行特征提取,仅训练一个小型关系头来推断相同实例的亲和力。该方法旨在提高图像中多类别计数的准确性并减少错误。

  2. TOOL · CL_259343 ·

    研究审计OpenAI CLIP在博物馆艺术数据中的偏见

    一项新近发表在arXiv上的研究,通过使用大都会艺术博物馆的艺术品元数据审计OpenAI CLIP模型,来调查视觉语言模型(VLMs)中的算法偏见。该研究开发了一个量化框架,用于评估零样本CLIP对数差分分数,并控制了艺术品媒介、创作时代和长宽比等因素。研究结果表明,艺术家性别对模型分数没有统计学上显著的条件效应,这表明广泛的零样本提示差分是一种粗略的测量方法,并不能明确证明模型的公平性。

  3. TOOL · CL_227256 ·

    图像增强技术被测试为深度学习图像检索系统的生成器

    本文介绍了一种利用图像增强技术作为测试生成器来测试深度学习图像检索系统的新方法。该研究对50种增强方法进行了分类,并实证评估了它们在生成多样化测试用例方面的有效性。使用Amazon Titan和OpenCLIP模型在CIFAR-10、ImageNet-1K和March Networks数据集上进行的实验表明,天气模拟和SaSPA技术在保持真实性的同时,产生了最高的嵌入不确定性和故障率。相反,基于GAN的增强由于合成伪影而显示出较低的真实性。

  4. TOOL · CL_211996 ·

    研究质疑分布偏移下零样本视觉语言模型的保形预测安全性

    一篇新发表在arXiv上的研究论文质疑了在数据分布偏移条件下部署的零样本视觉语言模型(VLMs)的保形预测(split-conformal prediction)作为安全措施的可靠性。研究发现,虽然边际覆盖率(marginal coverage)可能保持较高水平,但类别条件尾部覆盖率(class-conditional tail coverage)可能显著下降,某些类别的覆盖率接近于零。研究测试了各种校准技术,其中目标端类别校准(ta…

  5. TOOL · CL_216387 ·

    研究发现,分裂保角预测在分布偏移下对视觉语言模型未能实现类别条件安全

    一篇新论文研究了分裂保角预测作为零样本视觉语言模型(VLMs)在数据分布偏移条件下的安全层有效性。研究发现,尽管边际覆盖率可以保持较高水平,但类别条件覆盖率会显著下降,某些类别的覆盖率甚至在整体覆盖率约为86%时接近于零。测试了各种校准技术,其中目标侧类别校准显示出最大潜力,但需要大量的标记数据。研究得出结论,边际保角覆盖率应被视为平均可靠性指标,而不是特定类别的确定性安全保证。

  6. TOOL · CL_205244 ·

    像 Stable Diffusion 这样的 AI 图像模型现在通过 TypeScript 在浏览器中运行

    ONNX Runtime Web 和 WebGPU 的最新进展使得像 Stable Diffusion 和 Flux 这样的复杂 AI 模型能够直接在浏览器中使用 TypeScript 运行。这一转变将 AI 模型执行从专用的后端基础设施转移到客户端或边缘设备,显著改变了全栈工程实践。文章详细介绍了潜在扩散模型(LDMs)和校正流匹配(Rectified Flow Matching)的机制,解释了它们如何在压缩的潜在空间中运行,并利用…

  7. TOOL · CL_193809 ·

    新的LAMDA框架提升了AI交通标志识别的鲁棒性

    研究人员开发了一个名为LAMDA(Language-Anchored Model for Direction Alignment)的新训练框架,以增强自动驾驶汽车中交通标志识别模型的鲁棒性。该方法利用视觉-语言模型中的语言锚定结构,在不增加推理时间的情况下,提高了对阴影扰动和自然光干扰等对抗性攻击的性能。LAMDA在各种攻击类型和数据集上持续提高了鲁棒性,同时保持或提高了干净精度。

  8. TOOL · CL_181558 ·

    Agent-Reach v1.5.0 自动重定向 Bilibili 流量,保持代理程序正常运行

    Agent-Reach,一个面向编码代理的功能层,发布了 1.5.0 版本,当 Bilibili 在 2026 年 6 月开始使用 HTTP 412 错误阻止 yt-dlp 时,该版本自动将其 Bilibili 频道重定向到 bili-cli。此更新确保了代理程序可以在没有用户干预的情况下继续运行。新版本还将自身重新定义为功能层,而不是工具集合,为各种平台提供了有序的主备(plus-fallback)后端列表。

  9. TOOL · CL_166838 ·

    新型水下监测系统利用本地人工智能节省能源

    研究人员开发了一种新颖的、节能的水下监测系统,该系统将连续低功耗传感与按需本地推理相结合。该架构使用 MAX78000/MAX78002 微控制器进行持续信号监测,仅在需要处理或交互时才激活更强大的 NVIDIA Jetson Orin NX。该系统采用多模态管道进行数据摄取、目标提取和物种识别,并利用存储在 ChromaDB 中的 BioCLIP/OpenCLIP 嵌入。一个基于 LangChain 的多代理框架负责查询路由、能源和…

  10. TOOL · CL_154604 ·

    RegToken 将视觉 Transformer 的伪影再利用以改进图像生成

    研究人员开发了 RegToken,一种利用视觉 Transformer 中的“寄存器”来改进 token 化图像生成的新方法。这些寄存器通常被视为注意力伪影,被重新用作全局先验 token。通过应用涉及层局部化、子空间提取和投影的无训练过程,RegToken 在 ImageNet 等数据集上提高了图像生成质量和对齐指标。这种方法还可以在不改变模型预训练权重的情况下加速测试时间优化。

  11. RESEARCH · CL_129070 ·

    新的基准和数据集推动音频、图像和视频的深度伪造检测

    研究人员推出了几个新的数据集和基准,旨在改进跨各种媒体的深度伪造检测。Echoes 专注于音乐深度伪造,强调语义对齐和提供商多样性,以创建更强大的检测模型。VendorBench-100 提供了一个统一的框架,用于评估商业 API、视觉语言模型和开源检测器中的深度伪造图像检测,突出了性能差异和指标分歧。HumanForge 采用以人为中心的方​​法来检测深度伪造视频,使用多代理管道进行注释,并专注于人与物体以及人与人之间的交互。此外,…

  12. RESEARCH · CL_128855 ·

    新研究探讨扩散分类器的偏见和改进方法

    两篇新研究论文探讨了扩散分类器中的决策过程和偏见。第一篇论文介绍了MiPO,一种使用少数派偏好奖励来微调扩散模型以提高在代表性不足数据区域的分类准确性的方法。第二篇论文提出了ASOB-Bench,一个偏见评估框架,用于分析扩散分类器中的属性绑定、大小顺序偏见和背景依赖性,揭示了与传统视觉-语言模型相比的独特偏见特征。

  13. TOOL · CL_123323 ·

    新的自适应检查点技术可大幅减少视觉模型微调的GPU内存占用

    研究人员开发了一种自适应检查点算法,以减少微调视觉模型和视觉语言模型(VLMs)所需的GPU内存。该方法在显存有限的消费级GPU上进行了测试,在可控的能耗开销下,显著降低了峰值内存使用量,最高可达79%。研究还比较了各种参数高效微调(PEFT)技术,发现QLoRA和BitFit在准确性略有下降的情况下能节省大量能源,而DINOv2等自监督模型在某些任务上的表现优于微调模型。

  14. TOOL · CL_34198 ·

    OpenCLI 将网络变成命令行,节省 LLM 代币

    一个名为 OpenCLI 的开源项目正在 GitHub 上获得关注,它使用户能够通过命令行界面与网站和应用程序进行交互。该工具可以从各种在线平台提取结构化数据,包括社交媒体、微信和 Telegram 等聊天应用程序,以及 Arxiv 等学术存储库。一个关键特性是它能够在不产生大量语言模型代币成本的情况下执行这些操作,因为命令是在浏览器内部本地执行或直接通过系统调用执行的。OpenCLI 还支持桌面应用程序的自动化,并提供了一个插件系统…