PulseAugur
中
实时 10:23:43
实体 Vits

Vits

PulseAugur coverage of Vits — every cluster mentioning Vits across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
30
90 天内 30
发布 · 30天
0
90 天内 0
论文 · 30天
27
90 天内 27
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_284407 ·

    新的 ViT Token 缩减策略提升了分布外准确率

    研究人员为 Vision Transformer (ViTs) 开发了一种新的 Token 缩减策略,可在分布偏移下提高性能。这种“后期集中式”策略在后续层中移除更多 Token,与标准的“平坦式”策略相比,始终能提高分布外准确率。该方法以计算量的一小部分恢复了大部分原始准确率,在 ImageNet-C 和其他偏移数据集上,跨不同骨干网络和模态均显示出显著的提升,且无需进行每输入调优。

  2. TOOL · CL_259501 ·

    新的CRAFT框架通过自适应分辨率改进组织病理学图像分析

    研究人员开发了一个名为CRAFT(粗粒度到细粒度区域自适应特征标记)的新型自监督学习框架,用于组织病理学图像。这种基于DINO的方法学会自适应地分配空间分辨率,在保持更广泛上下文的同时细化信息区域。CRAFT在CAMELYON16和TCGA-Lung等数据集上,在分类和生存预测任务中表现出色,通常以更低的计算要求超越更大的模型。

  3. TOOL · CL_257237 ·

    evMLP:用于高效视觉处理的新型事件驱动MLP架构

    研究人员推出了一种新颖的全MLP架构evMLP,专为视觉任务,特别是视频处理而设计。该架构利用事件驱动机制,仅处理帧之间的变化区域,从而减少了冗余计算。evMLP在ImageNet等图像数据集上实现了具有竞争力的准确性,并在视频数据集上展示了显著的计算节省,这些节省在计算密集型条件下转化为实际的速度提升。

  4. TOOL · CL_245026 ·

    深度学习模型可实现皮肤癌的无活检亚型分析

    研究人员开发了一种使用 Vision Transformers (ViTs) 的深度学习模型,用于从皮肤镜图像中对 basal cell carcinoma (BCC) 进行亚型分析,有可能消除侵入性皮肤活检的需要。该模型在区分侵袭性 BCC 亚型与其他亚型方面取得了 0.784 的 AUC,优于传统的 CNN 和人类读者。通过提供一种非侵入性的 BCC 亚型分析方法,这种方法可以改善治疗计划和患者预后。

  5. COMMENTARY · CL_240862 ·

    机器人学在LfD和BC领域:讨论LLM和ViT的影响

    r/MachineLearning 子版块正在讨论从演示中学习(LfD)和行为克隆(BC)领域的研究现状。一个关键问题是,这些领域是否受到前沿大型语言模型(LLM)近期进展的影响,还是在独立发展。参与者还在询问视觉 Transformer(ViT)和视觉语言模型(VLM)在 LfD 和 BC 研究中的采用和影响,以及这些领域是否有其他值得注意的近期进展。

  6. TOOL · CL_227234 ·

    新基准评估用于地球观测变化检测的AI

    开发了一个新的基准来评估地球观测变化检测的AI方法,解决了当前研究中的不一致性。该基准标准化了评估协议,并在十个多样化的数据集和包括CNN和ViT在内的十个模型架构中考虑了预测准确性和计算效率。研究发现,当效率是一个因素时,优化的经典模型(如Siamese U-Nets)通常比复杂的当代模型表现更好,并且预训练在不增加推理成本的情况下持续提高性能。所有遵循FAIR原则的可复现性资源均公开可用。

  7. RESEARCH · CL_227067 ·

    新研究详细介绍了多模态大语言模型注意力和视觉搜索的进展

    两篇新研究论文探讨了多模态大语言模型(MLLMs)的进展。第一篇论文介绍了语义头特化(SHS),用于分析和改进Vision Transformer(ViT)的注意力头,从而产生一种更高效的混合注意力机制,称为Ariadne Attention。第二篇论文提出了VisLens,一种用于MLLMs中可解释视觉搜索的单通道方法,与现有方法相比显著降低了延迟。

  8. TOOL · CL_206697 ·

    EdgeCrafter: 紧凑型ViT用于边缘密集预测

    研究人员开发了EdgeCrafter,这是一个新的框架,利用专为边缘设备上的密集预测任务设计的紧凑型Vision Transformers (ViTs)。该框架解决了在严格的计算和内存限制下部署高性能模型的挑战,而传统上CNN架构(如YOLO)在此领域占据主导地位。EdgeCrafter采用任务专用蒸馏和对边缘友好的编码器-解码器设计,使紧凑型ViTs在物体检测、实例分割和姿态估计方面能够实现具有竞争力的精度-效率权衡。

  9. TOOL · CL_184997 ·

    Gemini API 图像标记成本详解

    Google 的 Gemini API 通过将图像分解为视觉块来对其进行标记化,成本取决于图像分辨率。高达 384x384 像素的图像被视为一个标记,成本为 258 个标记。较大的图像被分成 768x768 像素的图块网格,每个图块的成本为 258 个标记。这种标记化过程对于开发人员管理 API 成本和优化多模态应用程序中的上下文窗口使用至关重要。

  10. TOOL · CL_185519 ·

    MOAT防御流水线保护Vision Transformer免受效率下降攻击

    研究人员推出了一种新颖的防御流水线MOAT,旨在保护Vision Transformer(ViT)免受会降低其效率的对抗性攻击。MOAT采用一系列输入变换,使其具有模型无关性,并与用于降低计算成本的现有令牌修剪技术兼容。实验表明,MOAT有效地将攻击下的GFLOPs下降限制在原始模型性能的3.4%以内。

  11. TOOL · CL_185515 ·

    新的IRIS框架分析Vision Transformers中的方向选择性

    研究人员开发了一个名为IRIS的新框架,用于分析Vision Transformers (ViTs) 中方向选择性的产生方式。该框架使用受神经科学启发的指标来研究ViTs如何编码低级特征,类似于人眼视觉皮层处理信息的方式。研究发现,训练范式是影响方向选择性最重要的因素,许多单元在训练早期就变得具有选择性,而更深的层则转向语义编码。IRIS框架可以帮助跟踪ViT训练过程中受生物学启发的特征,并为如何优化层解冻以获得更好的下游泛化能力提供见解。

  12. RESEARCH · CL_169879 ·

    新的PTQ方法增强了Vision Transformer在边缘设备的效率

    两篇新研究论文介绍了用于Vision Transformer(ViTs)的先进训练后量化(PTQ)技术,以提高在资源受限设备上的效率。MixFrag通过估计组件脆弱性并将比特分配制定为背包问题,专注于自适应的层级精度分配,在ImageNet-1K上取得了有竞争力的性能,并在COCO目标检测上取得了最先进的结果。DopQ-ViT通过将量化与激活分布对齐并处理异常值来解决性能下降问题,提出了一种Tan量化器和一种MAD引导的最优缩放因子,…

  13. TOOL · CL_158553 ·

    BRIM加速器通过双边稀疏性提升DNN推理性能

    研究人员开发了BRIM,一种新颖的软硬件协同设计的比特串行稀疏推理加速器。该系统解决了双边稀疏性利用中固有的工作负载不平衡问题,该问题此前限制了处理效率。BRIM利用循环平衡剪枝和成对槽位捐赠,实现了超过90%的处理单元利用率,从而在各种神经网络架构上实现了显著的速度提升和能效改进。

  14. TOOL · CL_156621 ·

    InstructMixup 通过指令引导的斑块编辑增强深度视觉模型

    研究人员推出了一种新颖的数据增强技术 InstructMixup,旨在增强深度视觉模型的泛化能力。该方法通过提取图像中的显著性斑块,使用指令引导的生成模型对其进行精炼,然后将这些编辑过的斑块重新整合到同一图像的非显著性区域。这种方法确保在单个视觉样本内创建具有挑战性但标签一致的训练样本,同时在训练过程中增加的计算成本极小。该技术还通过将自相似分形结构融入显著性区域来进一步丰富表示。在包括 CNN、ViT 和 VLM 在内的各种基准和模…

  15. RESEARCH · CL_154526 ·

    Patch Policy 使用密集视觉特征实现高效机器人控制

    研究人员推出 Patch Policy,这是一种新颖的架构扩展,旨在通过有效利用 Vision Transformers (ViTs) 的密集视觉特征来增强机器人领域的具身控制。该方法允许基于 Transformer 的策略直接处理 patch token,避免了完整视觉-语言模型的计算负担。Patch Policy 取得了显著的改进,与全局池化表示相比,相对提高了 40%,并且在参数量仅为后者的几分之一的情况下,性能优于 OpenV…

  16. TOOL · CL_141658 ·

    新的 VFusion 方法通过利用内部表示来增强 Vision Transformer 分类

    研究人员推出了一种名为 VFusion 的新方法,该方法通过利用内部表示来增强 Vision Transformer (ViT) 的分类能力。与仅使用最后一层的传统方法不同,VFusion 整合了来自 ViT 内部层级的特征。这种垂直聚合策略通过有效纠正最后一层的故障并优于标准的集成方法,显著提高了分类准确性,尤其是在分布外场景下。

  17. RESEARCH · CL_135276 ·

    研究发现视觉Transformer比卷积神经网络更能模拟人类纹理感知

    一篇新的arXiv论文由Ludovica De Paolis撰写,比较了卷积神经网络(CNNs)和视觉Transformer(ViTs)如何表示纹理,这是视觉感知的一个关键方面。研究发现,ViTs创建的纹理表示与其复杂性无关,并且在识别纹理方面,人类的表现比CNNs更能被ViT表示所预测。这些发现表明,ViTs可能更准确地模拟人类纹理处理,而网络架构起着重要作用。

  18. TOOL · CL_129381 ·

    视觉模型适应性取决于高分辨率下的全局注意力

    研究人员发现,冻结的视觉基础模型适应细粒度分割任务的能力,很大程度上取决于骨干网络是否将全局注意力应用于高分辨率的令牌集。在整个网格上进行全局注意力的各向同性视觉 Transformer (ViT) 随着分辨率的提高而持续改进,而那些在全局阶段之前对信息进行池化的分层骨干网络则在较低分辨率下达到平台期。这种效应特定于低秩适应技术。一个名为 SALT (Side-stem, Attention-gated U-Net, Low-rank…

  19. RESEARCH · CL_128520 ·

    首个埃菲克语语音合成系统问世

    研究人员开发了首个端到端的文本到语音(TTS)系统,用于埃菲克语,一种在尼日利亚使用的低资源声调语言。该研究创建了一个包含2,632个发音的语料库,并评估了四种神经网络模型:VITS、MMS-TTS、SpeechT5和Orpheus-TTS。MMS-TTS表现最佳,MOS得分为3.80,但仍存在声调错误。研究结果强调了非洲语言需要更大的数据集和声调感知模型。

  20. TOOL · CL_114149 ·

    NagaTranslate 使用 LLMs、Whisper、VITS 构建低资源语言管线

    一个名为 NagaTranslate 的项目正在为印度那加兰邦的低资源语言(包括 Nagamese、Ao 和 Sema)开发翻译和语音管线。该系统利用商业 LLM API 进行文本翻译,利用微调后的 VITS 模型进行语音合成,并利用微调后的 Whisper 模型进行语音识别。开发者正在寻求关于自托管开放权重模型、处理 Nagamese 的拼写变体以及用有限数据提高 TTS/ASR 对地区口音的鲁棒性的建议。