PulseAugur
中
实时 06:57:14
实体 vision transformer

vision transformer

PulseAugur coverage of vision transformer — every cluster mentioning vision transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
203
90 天内 203
发布 · 30天
0
90 天内 0
论文 · 30天
201
90 天内 201
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_284718 ·

    在地球地形上训练的AI模型有望用于泰坦测绘

    一项名为CETUS的新研究论文探讨了将基于地球图像训练的图像表征迁移到使用Cassini合成孔径雷达(SAR)数据对土星卫星泰坦的地形进行分类的有效性。该研究将DINOv2、DOFA和CROMA模型的特征与经典的图像测量方法以及未训练的Vision Transformer进行了比较。虽然预训练编码器通常优于经典特征,但针对泰坦数据进行进一步训练后,不同模型的表现结果各异,这凸显了跨领域表征迁移在行星测绘中的复杂性。

  2. TOOL · CL_284598 ·

    AI模型改进土壤湿度预测但难以预测突发干旱

    一篇新的研究论文探讨了数据驱动方法在次季节土壤湿度预测中的有效性,特别是对欧洲突发干旱的预测。该研究利用了视觉Transformer架构,并发现预测问题的表述,包括目标表示(物理单位与标准化异常值)和残差学习的使用,对预测技能有显著影响。尽管该模型在现有基准测试中表现强劲,但预测突发干旱的快速加剧仍然是当前次季节到季节系统的根本挑战。

  3. TOOL · CL_284437 ·

    新的 QuAR 方法增强了量化视觉 Transformer

    研究人员开发了量化器对齐再校准 (QuAR),这是一种新颖的测试时自适应方法,专门为量化视觉 Transformer (ViTs) 设计。这种单通道方法在没有反向传播或参数更新的情况下重新校准激活,解决了量化模型在分布变化下的关键失效模式。QuAR 在 ImageNet-C 等基准测试中显著提高了准确性,优于现有的无反向传播方法,同时还降低了延迟和内存开销。

  4. TOOL · CL_275496 ·

    新研究探讨视觉 Transformer 中适配器放置的最优解

    研究人员探索了两种不同的方法来优化持续学习模型(特别是在视觉 Transformer 中)中特定任务适配器的放置。一种方法是放置搜索,涉及在各种块配置中训练适配器,并观察到倒 U 形的准确率曲线,在中间深度达到峰值。另一种受神经科学启发的方法,利用来自视觉皮层的脑功能成像 (fMRI) 读出数据来指导适配器分配,无需广泛搜索,即可在减少存储和运行时间的情况下实现具有竞争力的性能。

  5. TOOL · CL_275486 ·

    探索视觉Transformer曲率以提高对抗鲁棒性

    一篇题为“hZACH-ViT中的曲率受到攻击”的新研究论文,探讨了紧凑型视觉Transformer模型中曲率与各种因素的相互作用。该研究在MedMNIST数据集上进行,发现虽然庞加莱几何通常显示出较低的对抗攻击成功率,但其干净准确率也较低。降低庞加莱曲率可以提高干净准确率,但会显著增加在特定数据集上的对抗攻击成功率。研究表明,曲率、尺度和接近庞加莱边界共同影响这些模型中的干净识别和对抗鲁棒性。

  6. TOOL · CL_275257 ·

    函数空间Transformer自适应表示以应对科学和视觉任务

    研究人员推出函数空间Transformer (FST),一个旨在从离散样本表示的函数中学习的新颖框架。与使用固定网格的传统方法不同,FST采用一种空间自适应的连续潜在表示,其锚点位置根据输入观测值进行预测和优化。这种自适应方法使表示能够更好地匹配输入的空间组织,从而提高性能。FST在PDE预测任务上展示了优于Perceiver IO的结果,并在ImageNet-1K上以更少的参数实现了比Vision Transformer更高的准确率。

  7. TOOL · CL_268940 ·

    自监督学习模型在分析极光光谱方面表现出色

    研究人员开发了一种用于分析极光发射光谱的自监督学习方法,该方法利用在大量未标记光谱数据集上预训练的一维 Vision Transformer。该模型能有效恢复关键的物理诊断比率,并且在微调后,以显著更少的标签优于先前的监督方法。研究还探讨了现有光谱基础模型的迁移能力,发现不同光谱窗口训练的模型表现各异,其中一个光学模型显示出潜力,但未能完全匹配领域内预训练模型。

  8. RESEARCH · CL_268803 ·

    开发了用于痤疮严重程度分级和分析的AI框架

    研究人员开发了两种新的AI框架LENS-GRF和CG-HAF,用于通过AI对痤疮严重程度进行分级。LENS-GRF是一种置换不变网络,结合了面部全局上下文和详细病灶分析,在ACNE04数据集上实现了高精度。CG-HAF是一种全局-局部融合框架,整合了整体严重程度概率和病灶负担描述符,以提高可解释性和在序数分级上的性能。两种方法都强调了详细的病灶证据和可解释的融合策略对于准确痤疮评估的重要性,同时也指出了由于评分标准不同而导致的跨数据集…

  9. TOOL · CL_268790 ·

    新方法改进领域迁移下的量化模型选择

    研究人员开发了一种新的方法,用于选择最适合部署的量化模型,尤其是在面临领域迁移时。该方法称为教师锚定选择,侧重于最小化教师失真并利用输出分布估计器。该方法在 134 个独立训练的卷积模型和 Vision Transformer 模型上进行了测试,证明了在标签预算较少的情况下,可以减少遗憾。

  10. TOOL · CL_269480 ·

    论文探讨用于泰罗尼笔记识别的层次感知深度学习

    一篇新论文探讨了使用分层深度学习模型来识别泰罗尼笔记,这是一种古老的拉丁速记系统。研究人员在手写和手稿样本上比较了 ResNet18 和 Vision Transformers 等标准分类器与层次感知模型。结果表明,在适应性有限的情况下,分层模型表现更好,而平面分类器在少样本适应方面表现出色。

  11. TOOL · CL_261477 ·

    新的融合方法合并了不同的视觉模型

    研究人员开发了一种名为黎曼-洛伦兹参数融合(RLPF)的新颖方法,用于合并独立训练的视觉模型,即使它们的架构不同。该技术通过对齐参数组并将它们投影到通用坐标系来解决合并Vision Transformers(ViTs)和状态空间模型(SSMs)等模型的挑战。RLPF方法然后利用一个学习到的门来组合这些混合分支的输出,在CIFAR-10、Oxford-IIIT Pet和ImageNet-1K等基准数据集上展示了改进的性能。

  12. TOOL · CL_259532 ·

    STRADAViT 将 Vision Transformers 应用于射电天文学分析

    研究人员开发了 STRADAViT,一个旨在为射电天文学分析自适应 Vision Transformer (ViT) 主干的自监督框架。该框架利用了来自 Meerkat、ASKAP 和 LOFAR 等多个望远镜的大型数据集,以创建可迁移的编码器。STRADAViT 旨在改进不同成像管道和望远镜的射电源分析,在线性探测任务中表现出改进的性能,并在微调场景中取得混合结果。

  13. TOOL · CL_259175 ·

    量子启发式Transformer (QiT) 推进视觉识别

    研究人员开发了QiT,一种用于视觉识别任务的量子启发式Transformer模型。QiT利用了量子模型的结构思想,例如角度启发式编码和周期性特征自注意力,来创建一个模仿量子神经网络特性的经典Transformer。虽然不使用量子计算,QiT旨在经典模型中分离和评估受量子启发的归纳偏差。该模型在图像分类基准测试中表现出竞争力,其QiT-B变体在ImageNet-1K上达到了78.3%的top-1准确率。

  14. TOOL · CL_259159 ·

    WARD 框架通过自适应可靠性增强边缘 AI 视觉 Transformer

    研究人员开发了 WARD,一个旨在增强边缘 AI 应用中使用的视觉 Transformer 可靠性的新框架。WARD 通过采用通道级子网络划分和可靠性感知持续学习,解决了动态功耗预算、不断变化的可靠性需求和波动的输入分布的挑战。该框架支持四种不同的运行模式,允许计算成本和可靠性进行动态调整,以确保不间断的推理,即使在高错误率下也是如此。WARD 在 FPGA 加速器上实现,展示了最小的硬件开销和快速的模式转换能力,使其适用于实时边缘 AI 部署。

  15. TOOL · CL_255003 ·

    TokenMask简化视觉Transformer分割,提升效率

    研究人员开发了TokenMask,一种在Token空间直接操作的视觉Transformer分割新方法,无需进行密集的空间特征图重建。该方法简化了计算结构,降低了内存和计算需求,同时保持了具有竞争力的准确性。通过在NVIDIA Jetson AGX Orin等硬件上使用TensorRT实现更快的推理,TokenMask提高了效率和速度,尤其适用于嵌入式视觉系统。

  16. TOOL · CL_254259 ·

    人工智能优化CT扫描协议,以提高图像质量并降低辐射剂量

    研究人员开发了一个利用强化学习和虚拟成像试验来优化计算机断层扫描(CT)协议的新框架。该方法旨在通过智能地平衡采集和重建参数来提高诊断图像质量,同时最大限度地减少辐射暴露。一个基于视觉变换器(vision transformer)的患者特定嵌入(patient-specific embeddings)条件化的近端策略优化(Proximal Policy Optimization)代理,仅用穷举测试的2%就恢复了超过98%的最优目标,显…

  17. TOOL · CL_252206 ·

    无人机系统框架使用 Vision Transformer 检测小麦病毒

    研究人员开发了一种自动化流程,使用无人机系统 (UAS) 和多光谱图像检测甜玉米中的麦秆镶嵌病毒 (WSMV)。该框架集成了图像重建、对齐、植物提取和使用 Vision Transformer 进行分类。虽然该模型在使用基于处理的标签对超过 6,500 个测试斑块进行测试时达到了 89% 的准确率,但使用 ELISA-based ground truth 进行的进一步分析揭示了显著的标签噪声。这表明高准确率很大程度上是由于标签偏差,而…

  18. TOOL · CL_249529 ·

    ActMap 方法从单次生成量化 LLM 不确定性

    研究人员开发了 ActMap,一种从单次生成中量化大型语言模型不确定性的新颖方法。ActMap 将模型的内部激活轨迹压缩成一个紧凑的张量,然后可以由一个轻量级分类器进行分析,以估计正确答案的概率。通过在没有显著计算开销的情况下实现弃权、路由或选择性验证,这种方法为已部署模型的可扩展监督提供了实用的解决方案。

  19. TOOL · CL_247936 ·

    SegKAN模型将医学图像分割精度提高了1.78%

    一篇研究论文介绍了一种新颖的模型SegKAN,该模型专为高分辨率医学图像分割而设计,特别适用于CT扫描中的肝脏血管。该模型利用卷积网络结构增强图像嵌入,以减少噪声并防止梯度问题。它还将块之间的空间关系转换为时间关系,解决了传统Vision Transformer模型在捕获位置数据方面的局限性。实验表明,与现有的最先进方法相比,SegKAN的Dice分数提高了1.78%,证明了其在分割长距离物体方面的有效性。

  20. TOOL · CL_247896 ·

    新型Vision Transformer模型提升下水道缺陷分类能力

    研究人员开发了Sewer-Transformer-ML,一种新颖的Vision Transformer模型,用于下水道缺陷的多标签分类。该模型集成了多层次特征融合,并在Sewer-ML测试集上取得了最先进的性能,在$F2_{ ext{CIW}}$指标上显著优于第二名的方法。此外,还为资源受限环境引入了两种轻量级架构Sewer-MobileNet-ML和Sewer-Mobile-TransNet,在大幅减少参数量的同时保持了高精度。