PulseAugur
实时 12:38:42
实体 CLIP ViT-B/16

CLIP ViT-B/16

PulseAugur coverage of CLIP ViT-B/16 — every cluster mentioning CLIP ViT-B/16 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_221162 ·

    双曲几何提升树状原型网络性能

    研究人员探讨了潜在流形几何对分层分类模型的影响,比较了欧几里得空间和双曲空间。他们的发现表明,与欧几里得原型相比,双曲原型能显著保留最近邻图的拓扑结构。虽然欧几里得原型在原始特征上的表现与逻辑回归相似,但双曲拟合在局部检索任务中有所改进。

  2. TOOL · CL_227832 ·

    双曲几何增强了分类模型中的潜在空间拓扑

    研究人员探讨了潜在流形选择对分层分类模型的影响,将欧几里得空间与双曲空间(庞加莱球)进行了比较。他们的发现表明,与欧几里得原型相比,双曲原型在潜在空间中显著保留了最近邻图的拓扑结构。在各种参考树定义和分类任务中都观察到了这种改进,这表明双曲几何对于某些结构化数据表示具有切实的优势。

  3. TOOL · CL_79779 ·

    AI模型在历史文档图像分类中达到99%的准确率

    研究人员开发了一个高度准确的历史文档图像分类系统,能够区分文本、表格和图形。经过微调的深度学习模型,特别是RegNetY-16GF和ViT-large,在一个包含超过48,000页扫描文档的数据集上达到了99%以上的准确率。该系统旨在促进大规模数字化项目中特定内容的处理,模型、数据集和软件均已根据开源许可证公开提供。

  4. TOOL · CL_53872 ·

    视觉Transformer和混合模型在视网膜疾病筛查基准测试中领先

    研究人员对包括卷积神经网络、视觉Transformer、混合模型和视觉语言模型在内的各种深度学习架构进行了多种疾病视网膜筛查的基准测试。该研究使用了视网膜眼底多病图像数据集(RFMiD),并评估了在二元筛查和多标签分类任务上的性能。基于注意力的模型,特别是SwinTiny和CoAtNet0、MaxViTTiny等混合架构,在二元和多标签设置中均表现出优越性能。视觉语言模型具有竞争力,但未能超越最佳的Transformer和混合骨干网络…