PulseAugur
实时 09:50:18
实体 Vít

Vít

PulseAugur coverage of Vít — every cluster mentioning Vít across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
51
90 天内 154
发布 · 30天
0
90 天内 0
论文 · 30天
50
90 天内 150
层级分布 · 90 天
主题
关系
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/8 页 · 共 154 条
  1. TOOL · CL_216390 ·

    新AI框架提高皮肤病分类的公平性和准确性

    研究人员开发了一个名为MIFR(模态不变且公平的表示)的新框架,以提高用于皮肤病分类的AI模型的准确性和公平性。该框架解决了两个关键限制:依赖单一数据模态和不同肤色之间的性能差异。通过整合临床照片和皮肤镜图像,MIFR旨在创建一个更强大、更公平的诊断工具。

  2. TOOL · CL_208688 ·

    视觉Transformer在大型强子对撞机喷注分类方面优于CNN

    研究人员探索了将视觉Transformer (ViTs) 应用于使用大型强子对撞机量热仪图像进行夸克-胶子喷注分类。他们的研究利用了模拟的CMS Open Data,构建了多通道喷注视图图像,以实现端到端学习方法。研究结果表明,基于ViT的模型,特别是像ViT+MaxViT和ViT+ConvNeXt这样的混合架构,在准确率、F1分数和ROC-AUC方面优于传统的卷积神经网络,因为它们能有效地捕捉喷注子结构内的长距离空间相关性。

  3. TOOL · CL_208641 ·

    新框架通过组合式视觉取证提示增强人脸防伪能力

    研究人员开发了一个新的开放世界人脸防伪框架,以应对攻击类型中协变量和语义偏移带来的挑战。该组合式视觉取证提示学习框架在一个固定的基于ViT的视觉模型上运行,利用感知块的注意力将可学习的微取证原始信息提炼成局部证据单元。然后,特定类别的全局上下文提示自适应地选择并将这些原始信息组合成用于真实/伪造判别的提示,展示了最先进的性能和对未见攻击的强大泛化能力。

  4. TOOL · CL_208591 ·

    MagViT transformer框架提高了乳腺癌检测的准确性

    研究人员开发了MagViT,一个新颖的可解释多放大Transformer框架,用于乳腺组织病理学分类。该模型使用ViT骨干网络处理四个不同放大倍率(40X、100X、200X、400X)的图像,并采用可学习的门控机制进行尺度门控融合。MagViT在BreakHis数据集上表现强劲,实现了0.9643的平均患者准确率,并在BUSI和IDC等外部数据集上显示出良好的泛化能力。

  5. TOOL · CL_208409 ·

    PXDepth模型通过像素空间建模增强单目深度估计

    研究人员开发了PXDepth,这是一种新颖的单目深度估计模型,旨在更好地保留细粒度结构和物体边界。与以往结合大块ViT编码器和卷积解码器的方法不同,PXDepth将全局上下文建模与像素级预测分开。它利用大块ViT进行全局场景上下文建模,并使用上下文调制像素Transformer进行高分辨率空间表示,从而实现精确的局部几何和全局深度一致性。

  6. TOOL · CL_206652 ·

    新框架解释病理图像的基因表达预测

    研究人员开发了一个新颖的框架,利用vision transformers来解释HE染色病理图像的基因表达预测。该框架结合了相关性传播和概念发现,将形态学特征与转录组程序联系起来,提供局部和全局的见解。该方法应用于结直肠癌数据,可准确预测临床相关特征和分子表型,展示了其在更广泛的ViT基础病理模型中的潜力。

  7. TOOL · CL_206632 ·

    SCOUT框架支持对人脸识别模板进行直接语义编辑

    研究人员推出了一种新颖的框架SCOUT,旨在发现和直接操纵人脸识别模板中的语义概念。该方法利用机制可解释性来学习稀疏模板表示,并根据自然语言描述生成语义假设。SCOUT能够进行可控的、身份感知的模板编辑,而无需昂贵的重新编码过程,并在包括具有CNN、ViT和Swin骨干的各种人脸识别模型上证明了其有效性。

  8. TOOL · CL_206416 ·

    新框架揭示表征学习中的权衡

    研究人员开发了一个新的监督式解耦表征学习框架,旨在将个体潜在维度与不同的协变量对齐。该框架揭示了强制潜在独立性与实现精确潜在-协变量对齐之间固有的权衡。这种权衡决定了解耦机制的排序,每种机制都有相应的对齐成本。研究人员证明,这些发现可以事后应用于重新对齐来自预训练模型(如 CLIP、DINOv2 和 ViT)的表征,并集成到诸如信息因子分析(iFA)等概率模型中。在模拟和真实多组学数据上的实验表明,这些方法增强了结构化潜在表征的可控性。

  9. TOOL · CL_206192 ·

    UniTAC:AI图像压缩无需重新训练即可适应任务

    研究人员开发了UniTAC,一种专为机器人和自动驾驶汽车等物理AI系统设计的新型图像压缩方法。该系统能够实时调整其压缩策略以适应不断变化的下游任务,而无需重新训练。通过使用特定任务的权重向量来条件化编码器和解码器,UniTAC在显著降低数据速率的同时实现了高精度,其性能优于通用编解码器,并与专用编解码器非常接近。

  10. TOOL · CL_216364 ·

    新框架将组织形态学与基因表达预测联系起来

    研究人员开发了一个新的可解释框架,使用视觉Transformer (ViT) 模型将转录程序与组织形态学联系起来。该框架结合了相关性传播和概念发现,提供了关于形态学模式如何影响基因表达预测的局部和全局见解。应用于结直肠癌数据,该方法准确预测了临床相关特征和分子表型,展示了亚型间的空间异质性并区分了患者预后。

  11. TOOL · CL_204132 ·

    新方法揭示视觉模型中的空间捷径模式

    研究人员开发了一种新方法,通过将每张图像的贡献图分组为重复的空间模式,来识别和表征视觉模型中的捷径学习。该方法利用 K-means 和非负矩阵分解,揭示了在各种数据集和模型架构(如 ResNet 和 ViT)中,捷径和任务贡献的共享和不同空间模式。发现的捷径组能够针对性地检查错误率较高的图像子集,而抑制捷径贡献的干预措施会显著降低模型性能,这表明结合抑制和放大方法可以减少性能差异。

  12. TOOL · CL_200236 ·

    新的双流形几何方法增强深度学习表征

    研究人员提出了一种新颖的双流形视角用于深度表征学习,重点关注网络参数内的几何结构。该方法提出了一种核引导特征变换(KGFT)模块,它利用卷积滤波器的几何结构来指导特征表征的演变。KGFT通过将几何信息从核流形传递到数据流形,显式地重塑特征关系,从而在不施加过多约束的情况下增强表征学习。在ResNet、ViT和LLaMA-7B等各种架构上的实验表明,在图像分类和算术推理任务上取得了持续的改进,证明了该方法的通用性和有效性。

  13. TOOL · CL_198063 ·

    AI框架使用视觉Transformer和GRU检测蚊子传播疾病

    研究人员开发了一种新颖的混合框架,用于检测蚊子传播的疾病,特别是识别登革热病毒感染的蚊子。该系统集成了YOLO 11M模型进行初始蚊子识别和背景去除,然后使用视觉Transformer (ViT) 进行特征提取。最后,使用卷积GRU (ConvGRU) 分类器进行分类,该分类器在性能上优于其他循环神经网络模型。这种基于ConvGRU的方法实现了88.88%的准确率,有效地捕捉了蚊子运动中的空间特征和时间依赖性,从而实现了可靠的行为分析。

  14. TOOL · CL_198045 ·

    深度学习在乳腺癌边缘检测方面可与纹理分析相媲美

    研究人员探索了使用低倍荧光成像结合纹理分析和深度学习来检测乳腺癌边缘。他们的研究发现,这两种方法都达到了高精度,使用 Vision Transformers (ViT) 的深度学习模型在 4 倍放大倍率下达到了 96.30% 的敏感性和 98.18% 的准确率。研究结果表明,较低的放大倍率可提供与较高放大倍率相当的诊断性能,同时提供更大的视野和更快的图像捕获速度,使其成为术中边缘评估的更有效选择。

  15. TOOL · CL_196236 ·

    新AI模型通过眼底照片评估眼部健康

    研究人员开发了SpecF2M,一种新颖的多任务网络,用于从儿科眼底照片估计轴长和屈光不正。这种光谱感知的网络集成了解剖引导增强模块和混合空间-光谱骨干网络,用于估计轴长、球镜和柱镜等成分。在一项涉及超过4000次儿童就诊和近7000张眼底图像的研究中,SpecF2M在轴长和球镜估计方面表现优于标准的CNN和ViT基线模型,平均绝对误差分别为0.5347毫米和0.7062屈光度。研究结果表明,眼底摄影可用于筛查儿童近视指标,但临床应用前…

  16. TOOL · CL_195974 ·

    大脑核磁共振基础模型主要编码采集位点,而非解剖结构

    研究人员发现,当冷冻基础模型用于表示大脑核磁共振数据时,它们主要编码核磁共振采集的位点,而不是解剖或临床信息。这种效应在不同的队列、编码器和网络深度中都有观察到,即使是从随机初始化的模型或原始图像中,位点信息也高度可解码。虽然 ComBat 等方法可以去除这种位点指纹,但代价是会在共享子空间中将位点和解剖信息纠缠在一起。该研究建议对基础模型进行位点归因审计,并为此提供了一个开放的工具包。

  17. TOOL · CL_195956 ·

    深度学习模型用于乳腺癌检测的性能和排放基准测试

    一篇新论文对七种用于乳腺癌检测的深度学习模型进行了基准测试,评估了它们的性能和环境影响。研究发现,虽然EfficientNet和ResNet提供了高准确率,但它们也产生了更高的二氧化碳排放。DeiT-Tiny、ViT和Swin Transformer等Transformer模型取得了有竞争力的结果,其中DeiT-Tiny在一个数据集上提供了准确率和能源效率的良好平衡,而ViT和Swin在另一个数据集上表现出色。研究强调,在选择医学应用…

  18. RESEARCH · CL_195806 ·

    新的iBKD框架在数据稀疏情况下将CNN归纳偏置迁移到Vision Transformers

    研究人员开发了一个新的知识蒸馏框架iBKD,旨在提高Vision Transformers (ViTs) 在训练数据有限时的性能。该方法通过在整个训练过程中保留空间网格结构,有效地将卷积神经网络 (CNNs) 的归纳偏置迁移到ViTs。iBKD中的核心归纳偏置注意力模块可以锐化结构线索并将其注入ViT,从而在部署时得到一个未修改的ViT,没有额外的推理开销。iBKD在多个基准测试中,尤其是在数据稀疏的情况下,表现优于现有方法。

  19. TOOL · CL_194136 ·

    新的AQUA20数据集旨在解决具有挑战性的水下物种分类问题

    研究人员推出了AQUA20,这是一个旨在改进水下物种分类的新基准数据集。该数据集包含20种海洋物种的8,171张图像,经过专门策划,以应对浊度、低光照和遮挡等挑战。对十三种深度学习模型进行了实验,其中ConvNeXt在90.69%的Top-1准确率和88.92%的F1分数方面表现出最高的准确率,尽管其他模型也显示出不同的性能权衡。该研究还包括使用GRAD-CAM和LIME进行的解释性分析,以解释模型行为。

  20. TOOL · CL_194042 ·

    新的视觉令牌编码器提高了 ViT 特征压缩效率

    研究人员开发了一种名为视觉令牌编码器(VTC)的新方法,用于压缩 Vision Transformer(ViT)模型中的中间特征。VTC 有效地利用了 ViT 补丁令牌中固有的空间相关性,而这些相关性常常被现有编码器所忽略。该双路径编码器将全局令牌和补丁令牌分开,并对每个令牌应用专门的压缩技术。实验表明,VTC 在各种任务(如分类、分割和检测)上的性能显著优于当前的 ViT 特征编码基线,在极低比特率下实现了高性能。