PulseAugur
实时 05:44:42
实体 vision transformer

vision transformer

PulseAugur coverage of vision transformer — every cluster mentioning vision transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
37
90 天内 160
发布 · 30天
0
90 天内 0
论文 · 30天
36
90 天内 158
层级分布 · 90 天
主题
关系
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/8 页 · 共 160 条
  1. TOOL · CL_208688 ·

    视觉Transformer在大型强子对撞机喷注分类方面优于CNN

    研究人员探索了将视觉Transformer (ViTs) 应用于使用大型强子对撞机量热仪图像进行夸克-胶子喷注分类。他们的研究利用了模拟的CMS Open Data,构建了多通道喷注视图图像,以实现端到端学习方法。研究结果表明,基于ViT的模型,特别是像ViT+MaxViT和ViT+ConvNeXt这样的混合架构,在准确率、F1分数和ROC-AUC方面优于传统的卷积神经网络,因为它们能有效地捕捉喷注子结构内的长距离空间相关性。

  2. TOOL · CL_208683 ·

    新型混合深度学习模型改进糖尿病视网膜病变分级

    研究人员开发了ORViT-DR,一个新颖的混合深度学习框架,旨在改进从低分辨率视网膜图像中糖尿病视网膜病变的 grading。该方法整合了卷积特征提取和基于 Transformer 的全局上下文建模,利用了预训练的 ViT-Hybrid 主干,该主干结合了 BiT-ResNetv2 和 Vision Transformer。在 RetinaMNIST 数据集上进行测试,ORViT-DR 实现了 57.00% 的分类准确率、0.5963…

  3. TOOL · CL_206643 ·

    CephViT模型自动进行头颅测量标志点定位以进行错颌畸形分类

    研究人员开发了CephViT,一个用于自动2D侧位头颅测量标志点定位的Vision Transformer模型。该模型在一个公开数据集上进行了训练和评估,平均径向误差为1.28毫米,在3.0毫米处的成功检测率为92.0%。当通过生成数字重建放射照片(DRRs)应用于3D CBCT扫描时,CephViT定位的标志点在骨骼错颌畸形分类方面显示出与手动标注相当的准确性,准确率分别为70.0%和68.3%。这表明使用CBCT衍生的DRRs进行…

  4. TOOL · CL_206549 ·

    新型编织视觉Transformer可从视网膜图像中检测中风

    研究人员开发了一种新颖的编织视觉Transformer (BViT) 模型,用于利用眼底成像检测中风。该方法利用双眼的多个视角图像来捕捉指示脑血管事件的细微视网膜模式。在自定义数据集上的实验中,BViT模型在中风检测中取得了0.75的AUC分数,优于标准的视觉Transformer。

  5. TOOL · CL_206444 ·

    视觉Transformer高精度地从心电图中检测心脏病

    研究人员开发了一种视觉Transformer模型,能够从标准心电图(ECG)中检测左心室射血分数(LVEF)降低。该模型在多个临床中心的10,000多名患者身上进行了训练,在外部验证队列中达到了0.88的AUROC。该模型的注意力图突出了对QRS波群的关注,提供了可解释性,并表明常规心电图可以作为识别需要进一步超声心动图检查的患者的可扩展筛查工具。

  6. TOOL · CL_206441 ·

    交叉验证改进了医疗影像AI的超参数调优

    一篇新的研究论文探讨了深度学习图像分类器的超参数优化(HPO),特别是在医疗影像领域,因为该领域数据集通常较小。研究比较了三种HPO协议:固定留出法、重排留出法和5折交叉验证。结果表明,交叉验证提供了更可靠的测试性能估计,尤其是在数据有限的情况下,尽管它需要更多的计算资源。对于像Tiny ImageNet这样的大型数据集,不同协议之间的差异可以忽略不计。

  7. TOOL · CL_206192 ·

    UniTAC:AI图像压缩无需重新训练即可适应任务

    研究人员开发了UniTAC,一种专为机器人和自动驾驶汽车等物理AI系统设计的新型图像压缩方法。该系统能够实时调整其压缩策略以适应不断变化的下游任务,而无需重新训练。通过使用特定任务的权重向量来条件化编码器和解码器,UniTAC在显著降低数据速率的同时实现了高精度,其性能优于通用编解码器,并与专用编解码器非常接近。

  8. TOOL · CL_206170 ·

    合成数据提升了对乌克兰战争损毁农田的AI分析能力

    研究人员开发了一种使用合成数据增强来改进乌克兰战场损毁农田分析的方法。通过在真实卫星图像上训练生成模型,如生成对抗网络(GANs)和去噪扩散概率模型(DDPMs),他们生成了被炸毁和未被炸毁农田的额外样本。当这些合成图像用于训练Vision Transformer分类器时,性能显著提高,平衡准确率从67%提高到81%,代表性不足的未被炸毁类别的召回率从41%提高到69%。这种方法在数据稀缺、受战争影响的地区显示出地理空间应用的潜力。

  9. TOOL · CL_206149 ·

    新型AI模型TokenSTFormer提高脊柱侧弯筛查准确性

    研究人员开发了TokenSTFormer,这是一种用于通过分析步态视频筛查青少年特发性脊柱侧弯(AIS)的新型模型。该模型利用标记化的空间和时间注意力机制来改进特征表示和收敛性。包含1,516个步态片段和X光记录的ScoliGait数据集被用于训练和评估TokenSTFormer,其准确率达到0.79,优于标准的Vision Transformer模型。

  10. TOOL · CL_206136 ·

    深度学习模型在肺癌组织病理学分析方面进行基准测试

    研究人员开发了一个用于分析肺癌组织病理学图像的两阶段深度学习框架。该框架系统地比较了用于组织分类和区域分割的最先进架构。在分类任务中,YOLO11 表现最佳,准确率达到 98.38%。在分割任务中,DeepLabV3+ 取得了最佳结果,交并比(Intersection over Union)为 0.80,尽管 YOLO11-seg 提供的性能相当,但参数却少得多。

  11. TOOL · CL_204124 ·

    新的 PPOM 方法增强了视觉-语言模型的泛化能力

    研究人员开发了一种名为 Patch-Phase Orbit Marginalization (PPOM) 的新方法,以提高视觉-语言模型的可泛化性。该技术解决了当前提示微调方法对冻结视觉变换器中图像块的空间对齐的敏感性问题。PPOM 作为一种无需训练的算子,通过对相位偏移进行边缘化处理,有效降低了由块网格对齐引起的预测变异性。通过评估图像的翻译视图并整合它们的预测,PPOM 在各种提示学习框架中提高了模型性能,而无需重新训练。

  12. TOOL · CL_203808 ·

    新AI方法从RIXS光谱数据中推断哈密顿量参数

    研究人员应用了基于仿真的推理,利用视觉Transformer编码器来分析共振非弹性X射线散射(RIXS)光谱数据。这种新颖的方法有效地约束了先验并估计了联合密度,从而能够推断Ni$^{2+}$化合物NiPS$_3$和K$_2$NiF$_4$的哈密顿量参数的完整后验分布。该方法成功地恢复了参数相关性,并准确匹配了观测到的光谱,解锁了新的分析能力,如干扰项边缘化不确定性量化和多测量后验融合。

  13. TOOL · CL_200235 ·

    新的GDI方法提高了太阳能电池板的缺陷分类能力

    研究人员开发了一种名为生成式缺陷隔离(GDI)的新方法,以改进光伏组件中多缺陷的分类。GDI使用带有快速傅里叶卷积的LaMa修复模型生成具有单一缺陷的逼真训练样本,解决了多标签缺陷分类中的学习模糊性和数据稀缺性挑战。实验表明,GDI显著提高了Vision Transformer和EfficientNetV2-L架构的性能,尤其是在数据量较少的情况下,从而大幅提高了罕见缺陷类别的F1分数,并减少了共现缺陷的分类错误。

  14. TOOL · CL_198246 ·

    视觉模型可以解读雷达显示屏以评估空中交通复杂性

    研究人员已经证明了使用视觉模型来解读雷达显示屏以估计空中交通复杂性的可行性。尽管雷达图像具有独特的视觉特征,例如稀疏的飞机斑块和自相似性,但一个 Vision Transformer (ViT) 模型经过训练,在回归复杂性组件方面取得了高精度。该模型的性能,特别是其根据飞机对复杂性的贡献而移除飞机时的比例响应,表明雷达图像是基于深度学习的空中交通建模的可行输入。

  15. TOOL · CL_198063 ·

    AI框架使用视觉Transformer和GRU检测蚊子传播疾病

    研究人员开发了一种新颖的混合框架,用于检测蚊子传播的疾病,特别是识别登革热病毒感染的蚊子。该系统集成了YOLO 11M模型进行初始蚊子识别和背景去除,然后使用视觉Transformer (ViT) 进行特征提取。最后,使用卷积GRU (ConvGRU) 分类器进行分类,该分类器在性能上优于其他循环神经网络模型。这种基于ConvGRU的方法实现了88.88%的准确率,有效地捕捉了蚊子运动中的空间特征和时间依赖性,从而实现了可靠的行为分析。

  16. TOOL · CL_198045 ·

    深度学习在乳腺癌边缘检测方面可与纹理分析相媲美

    研究人员探索了使用低倍荧光成像结合纹理分析和深度学习来检测乳腺癌边缘。他们的研究发现,这两种方法都达到了高精度,使用 Vision Transformers (ViT) 的深度学习模型在 4 倍放大倍率下达到了 96.30% 的敏感性和 98.18% 的准确率。研究结果表明,较低的放大倍率可提供与较高放大倍率相当的诊断性能,同时提供更大的视野和更快的图像捕获速度,使其成为术中边缘评估的更有效选择。

  17. TOOL · CL_193888 ·

    新模型大幅削减面部情感识别计算量

    研究人员开发了一种名为稀疏注意力情感识别(SAE)的新模型,用于面部情感识别。该模型通过丢弃多达90%的图像令牌,仅关注眼睛和嘴巴等区分性区域,从而显著降低了计算复杂性。尽管进行了这种缩减,SAE仍实现了具有竞争力的准确性,并在RAF-DB数据集上创下了新的最先进水平,为边缘部署提供了更有效的方法。

  18. TOOL · CL_193817 ·

    AI模型无需标签即可通过面部和语音筛查帕金森病

    研究人员开发了一种新颖的方法,仅使用面部表情和语音分析来筛查帕金森病,无需直接的PD标签。该方法利用了冻结的预训练编码器,特别是用于面部数据的Vision Transformer和用于语音的HuBERT。当融合两种模态时,该系统实现了0.802的AUROC,显示出在临床环境中进行排除性分诊的潜力。

  19. TOOL · CL_185499 ·

    新的 Vision Transformer 框架增强了稀疏 dToF 深度补全

    研究人员开发了一种新的框架,用于从稀疏的直接飞行时间 (dToF) 传感器进行密集度量深度补全。该方法利用一个深度引导的双分支 Vision Transformer 编码器,该编码器分别处理 RGB 图像和稀疏 dToF 测量,并通过掩码联合注意力模块有效引导图像特征的深度令牌。该系统完全在由全面的 dToF 模拟管道生成的合成数据上进行训练,该管道复制了各种传感器类型和退化特性。这种方法在多个数据集和真实世界的 dToF 设备上实现…

  20. TOOL · CL_185476 ·

    PADFormer 使用 Vision Transformer 进行姿态无关的异常检测

    研究人员推出 PADFormer,一种用于检测图像异常的新方法,该方法可以处理显著的姿态变化,而无需复杂的 3D 重建。该方法利用 Vision Transformer (ViT) 直接重建无异常的图像版本,同时保留姿态信息。PADFormer 仅在正常数据上进行训练,并采用动态补丁选择和空间对齐技术,从稀疏参考视图中学习,在异常检测基准测试中取得了最先进的成果。