PulseAugur
实时 05:44:30
实体 Vits

Vits

PulseAugur coverage of Vits — every cluster mentioning Vits across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 22
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_206697 ·

    EdgeCrafter: 紧凑型ViT用于边缘密集预测

    研究人员开发了EdgeCrafter,这是一个新的框架,利用专为边缘设备上的密集预测任务设计的紧凑型Vision Transformers (ViTs)。该框架解决了在严格的计算和内存限制下部署高性能模型的挑战,而传统上CNN架构(如YOLO)在此领域占据主导地位。EdgeCrafter采用任务专用蒸馏和对边缘友好的编码器-解码器设计,使紧凑型ViTs在物体检测、实例分割和姿态估计方面能够实现具有竞争力的精度-效率权衡。

  2. TOOL · CL_184997 ·

    Gemini API 图像标记成本详解

    Google 的 Gemini API 通过将图像分解为视觉块来对其进行标记化,成本取决于图像分辨率。高达 384x384 像素的图像被视为一个标记,成本为 258 个标记。较大的图像被分成 768x768 像素的图块网格,每个图块的成本为 258 个标记。这种标记化过程对于开发人员管理 API 成本和优化多模态应用程序中的上下文窗口使用至关重要。

  3. TOOL · CL_185519 ·

    MOAT防御流水线保护Vision Transformer免受效率下降攻击

    研究人员推出了一种新颖的防御流水线MOAT,旨在保护Vision Transformer(ViT)免受会降低其效率的对抗性攻击。MOAT采用一系列输入变换,使其具有模型无关性,并与用于降低计算成本的现有令牌修剪技术兼容。实验表明,MOAT有效地将攻击下的GFLOPs下降限制在原始模型性能的3.4%以内。

  4. TOOL · CL_185515 ·

    新的IRIS框架分析Vision Transformers中的方向选择性

    研究人员开发了一个名为IRIS的新框架,用于分析Vision Transformers (ViTs) 中方向选择性的产生方式。该框架使用受神经科学启发的指标来研究ViTs如何编码低级特征,类似于人眼视觉皮层处理信息的方式。研究发现,训练范式是影响方向选择性最重要的因素,许多单元在训练早期就变得具有选择性,而更深的层则转向语义编码。IRIS框架可以帮助跟踪ViT训练过程中受生物学启发的特征,并为如何优化层解冻以获得更好的下游泛化能力提供见解。

  5. RESEARCH · CL_169879 ·

    新的PTQ方法增强了Vision Transformer在边缘设备的效率

    两篇新研究论文介绍了用于Vision Transformer(ViTs)的先进训练后量化(PTQ)技术,以提高在资源受限设备上的效率。MixFrag通过估计组件脆弱性并将比特分配制定为背包问题,专注于自适应的层级精度分配,在ImageNet-1K上取得了有竞争力的性能,并在COCO目标检测上取得了最先进的结果。DopQ-ViT通过将量化与激活分布对齐并处理异常值来解决性能下降问题,提出了一种Tan量化器和一种MAD引导的最优缩放因子,…

  6. TOOL · CL_158553 ·

    BRIM加速器通过双边稀疏性提升DNN推理性能

    研究人员开发了BRIM,一种新颖的软硬件协同设计的比特串行稀疏推理加速器。该系统解决了双边稀疏性利用中固有的工作负载不平衡问题,该问题此前限制了处理效率。BRIM利用循环平衡剪枝和成对槽位捐赠,实现了超过90%的处理单元利用率,从而在各种神经网络架构上实现了显著的速度提升和能效改进。

  7. TOOL · CL_156621 ·

    InstructMixup 通过指令引导的斑块编辑增强深度视觉模型

    研究人员推出了一种新颖的数据增强技术 InstructMixup,旨在增强深度视觉模型的泛化能力。该方法通过提取图像中的显著性斑块,使用指令引导的生成模型对其进行精炼,然后将这些编辑过的斑块重新整合到同一图像的非显著性区域。这种方法确保在单个视觉样本内创建具有挑战性但标签一致的训练样本,同时在训练过程中增加的计算成本极小。该技术还通过将自相似分形结构融入显著性区域来进一步丰富表示。在包括 CNN、ViT 和 VLM 在内的各种基准和模…

  8. RESEARCH · CL_154526 ·

    Patch Policy 使用密集视觉特征实现高效机器人控制

    研究人员推出 Patch Policy,这是一种新颖的架构扩展,旨在通过有效利用 Vision Transformers (ViTs) 的密集视觉特征来增强机器人领域的具身控制。该方法允许基于 Transformer 的策略直接处理 patch token,避免了完整视觉-语言模型的计算负担。Patch Policy 取得了显著的改进,与全局池化表示相比,相对提高了 40%,并且在参数量仅为后者的几分之一的情况下,性能优于 OpenV…

  9. TOOL · CL_141658 ·

    新的 VFusion 方法通过利用内部表示来增强 Vision Transformer 分类

    研究人员推出了一种名为 VFusion 的新方法,该方法通过利用内部表示来增强 Vision Transformer (ViT) 的分类能力。与仅使用最后一层的传统方法不同,VFusion 整合了来自 ViT 内部层级的特征。这种垂直聚合策略通过有效纠正最后一层的故障并优于标准的集成方法,显著提高了分类准确性,尤其是在分布外场景下。

  10. RESEARCH · CL_135276 ·

    研究发现视觉Transformer比卷积神经网络更能模拟人类纹理感知

    一篇新的arXiv论文由Ludovica De Paolis撰写,比较了卷积神经网络(CNNs)和视觉Transformer(ViTs)如何表示纹理,这是视觉感知的一个关键方面。研究发现,ViTs创建的纹理表示与其复杂性无关,并且在识别纹理方面,人类的表现比CNNs更能被ViT表示所预测。这些发现表明,ViTs可能更准确地模拟人类纹理处理,而网络架构起着重要作用。

  11. TOOL · CL_129381 ·

    视觉模型适应性取决于高分辨率下的全局注意力

    研究人员发现,冻结的视觉基础模型适应细粒度分割任务的能力,很大程度上取决于骨干网络是否将全局注意力应用于高分辨率的令牌集。在整个网格上进行全局注意力的各向同性视觉 Transformer (ViT) 随着分辨率的提高而持续改进,而那些在全局阶段之前对信息进行池化的分层骨干网络则在较低分辨率下达到平台期。这种效应特定于低秩适应技术。一个名为 SALT (Side-stem, Attention-gated U-Net, Low-rank…

  12. RESEARCH · CL_128520 ·

    首个埃菲克语语音合成系统问世

    研究人员开发了首个端到端的文本到语音(TTS)系统,用于埃菲克语,一种在尼日利亚使用的低资源声调语言。该研究创建了一个包含2,632个发音的语料库,并评估了四种神经网络模型:VITS、MMS-TTS、SpeechT5和Orpheus-TTS。MMS-TTS表现最佳,MOS得分为3.80,但仍存在声调错误。研究结果强调了非洲语言需要更大的数据集和声调感知模型。

  13. TOOL · CL_114149 ·

    NagaTranslate 使用 LLMs、Whisper、VITS 构建低资源语言管线

    一个名为 NagaTranslate 的项目正在为印度那加兰邦的低资源语言(包括 Nagamese、Ao 和 Sema)开发翻译和语音管线。该系统利用商业 LLM API 进行文本翻译,利用微调后的 VITS 模型进行语音合成,并利用微调后的 Whisper 模型进行语音识别。开发者正在寻求关于自托管开放权重模型、处理 Nagamese 的拼写变体以及用有限数据提高 TTS/ASR 对地区口音的鲁棒性的建议。

  14. RESEARCH · CL_97987 ·

    新框架探究 Vision Transformer 的几何结构和表征动态

    研究人员引入了 Transformer Geometry Observatory (TGO) 框架,旨在探索 Vision Transformers (ViTs) 的表征几何结构。首个版本 TGO-I 专门研究 ViT 表征的光谱几何结构。在 ImageNet-100 上训练的 ViT-Small/16 模型实验表明,随着训练的进行,维度利用率增加,而各向异性降低。与预期相反,信息在表征维度之间重新分配,而不是集中在少数几个主导方向上…

  15. RESEARCH · CL_68555 ·

    $A^2$ 方法使用小型 ViT 实现更好的物体定位

    研究人员开发了一种名为 $A^2$ 的新方法,通过更好地定位前景物体来改进视觉分类。令人惊讶的是,更小的自监督 Vision Transformers (ViTs) 比更大的 ViTs 产生更准确的定位注意力图。$A^2$ 方法结合了用于注意力裁剪的小型 ViT 和用于丰富特征提取的大型 ViT,在五个基准测试中取得了有竞争力的结果,而无需分组标签或特定数据集的训练。

  16. RESEARCH · CL_66328 ·

    新型 AI 模型提升医学图像分割精度

    研究人员开发了两种改进医学图像分割的新方法。一种方法通过添加轻量级边界框预测器来增强 MedSAM 模型,该预测器使用单击即可估算边界框,以最小的开销提高了在各种数据集上的准确性。另一种方法探索纯粹的 VRWKV 模型,引入了频率感知小波注意力和多尺度通道融合模块,即使参数更少,也能与现有方法相比取得具有竞争力或更优的性能。

  17. RESEARCH · CL_65987 ·

    LLM激活尖峰被识别为结构向量偏见

    研究人员发现,大型语言模型(LLM)中的大规模激活尖峰并非简单的标量偏见,而是特定token内的结构向量偏见。这些向量通过模型的投影权重和位置嵌入得以保留,即使在扰动下也是如此。为了解决这些尖峰在量化过程中造成的性能下降问题,开发了一种名为INSERTQUANT的新型训练后量化框架。该方法对尖峰进行钳制并恢复其功能,从而能够实现跨模态的高保真度、鲁棒的低比特量化。

  18. TOOL · CL_58778 ·

    新的模型融合技术提高了零样本性能

    研究人员开发了一种新的以神经元为中心的模型融合方法,解决了独立训练的神经网络中表示发散带来的挑战。该方法将融合视为一个表示匹配问题,对齐模型间的中间神经元以近似目标表示。它结合了神经元归因分数来优先考虑显著特征,并适用于各种架构,尤其在零样本和非独立同分布(non-IID)数据场景下表现出显著的改进。

  19. TOOL · CL_40938 ·

    UniRefiner 框架教会 ViT 丢弃虚假 token

    研究人员开发了 UniRefiner,一个旨在提高 Vision Transformer (ViT) 模型空间精度的框架。该方法教会预训练的 ViT 识别和丢弃可能降低空间敏感任务性能的无关或虚假 token。通过使用对比寄存器和双重目标,UniRefiner 能够以最小的微调来优化各种 ViT,从而在语义分割等任务中取得显著改进。

  20. TOOL · CL_37975 ·

    新的MARR技术提升了LLM和ViT的低比特量化性能

    研究人员开发了一种名为模块自适应残差重构(MARR)的新技术,以改进大型语言模型和视觉变换器的低比特训练后量化。MARR通过自适应地平衡不同模型模块之间的误差校正和偏差来解决现有方法的局限性。该方法使用特定于模块的缩放系数和基于PID的更新策略来优化系数,从而在4位或更低的量化级别上带来显著的性能提升。