实体
CLIP ViT-B/16
CLIP ViT-B/16
PulseAugur coverage of CLIP ViT-B/16 — every cluster mentioning CLIP ViT-B/16 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI模型在历史文档图像分类中达到99%的准确率
研究人员开发了一个高度准确的历史文档图像分类系统,能够区分文本、表格和图形。经过微调的深度学习模型,特别是RegNetY-16GF和ViT-large,在一个包含超过48,000页扫描文档的数据集上达到了99%以上的准确率。该系统旨在促进大规模数字化项目中特定内容的处理,模型、数据集和软件均已根据开源许可证公开提供。
-
视觉Transformer和混合模型在视网膜疾病筛查基准测试中领先
研究人员对包括卷积神经网络、视觉Transformer、混合模型和视觉语言模型在内的各种深度学习架构进行了多种疾病视网膜筛查的基准测试。该研究使用了视网膜眼底多病图像数据集(RFMiD),并评估了在二元筛查和多标签分类任务上的性能。基于注意力的模型,特别是SwinTiny和CoAtNet0、MaxViTTiny等混合架构,在二元和多标签设置中均表现出优越性能。视觉语言模型具有竞争力,但未能超越最佳的Transformer和混合骨干网络…