PulseAugur
中
实时 08:56:10
实体 Vision Transformer Large

Vision Transformer Large

PulseAugur coverage of Vision Transformer Large — every cluster mentioning Vision Transformer Large across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_273486 ·

    DCM-SAM 系统改进了金属增材制造中的缺陷分割

    研究人员开发了 DCM-SAM,这是一种用于通过 X 射线计算机断层扫描分割金属增材制造零件中缺陷的新型系统。该系统采用缺陷条件自适应 LoRA 专家混合模型,利用固定的 Segment Anything 主干,并为每个缺陷类别配备单独的 LoRA 专家。DCM-SAM 仅使用合成数据进行训练,就能在未直接接触真实扫描的情况下实现高精度。该系统还解决了在 AI 加速器上部署的挑战,针对 Qualcomm Hexagon NPU 进行了…

  2. TOOL · CL_257197 ·

    Hyper-RED框架使用超图进行可扩展事件相机预训练

    研究人员开发了Hyper-RED,一个旨在改进事件相机表示学习的新型预训练框架。该方法利用语义超图将高阶语义结构从图像传输到事件数据,克服了先前强制刚性对齐的图像到事件技术的局限性。通过对跨多个token的语义关联进行建模和对齐,Hyper-RED实现了更有效的跨模态知识迁移,在基于事件的任务上取得了最先进的性能。

  3. TOOL · CL_254753 ·

    鸟类识别模型:边缘设备上的分辨率与架构权衡

    一项新研究调查了鸟类物种识别模型的最佳输入分辨率,特别是对于像NVIDIA Jetson Orin Nano这样的边缘设备。研究人员发现,模型架构对准确性的影响比输入分辨率更大,像DINOv2-L这样的模型在更大的分辨率下能实现更高的准确性。研究还强调了在部署引擎上测量准确性的重要性,因为半精度计算会降低某些架构(如ViT-S/16)的性能,而CNN则基本不受影响。该研究探索了14种输入分辨率和六种架构,测量了延迟和准确性的权衡,为诸…

  4. TOOL · CL_244781 ·

    新的ARC-Bench协议揭示了冻结JEPA世界模型的关键缺陷

    研究人员开发了ARC-Bench,一个旨在评估冻结潜在世界模型动作排序能力的新评估协议。研究发现,这些通过根据预测的未来嵌入对候选动作进行评分来进行规划的模型,常常无法正确排序动作。由于闭环重规划机制,这一缺陷在很大程度上未被发现,导致次优的动作选择,并夸大了潜在表征的真实性能。即使使用不同的视觉骨干网络,包括V-JEPA 1和V-JEPA 2,研究结果也保持一致。

  5. TOOL · CL_231424 ·

    新 ViTAMINS 方法通过合成负样本增强视觉 Transformer 训练

    研究人员开发了 ViTAMINS,一种通过引入合成难负样本来训练自监督视觉 Transformer 的新方法。该方法提高了表示质量,在 ImageNet 等基准测试以及图像检索和分割等各种下游任务上取得了显著改进。该方法展示了涌现的分类能力,性能优于现有基线,甚至超过了像 V-JEPA with ViT-L 这样的大型模型。与对比学习中的生成方法和自蒸馏方法相比,ViTAMINS 提供了一种更具资源效率且功能更强大的替代方案。

  6. TOOL · CL_227223 ·

    新的MemMTL框架利用原型记忆增强多任务密集预测

    研究人员开发了MemMTL,一个用于多任务密集预测的新框架,它利用一个可学习的任务状态原型记忆。该记忆精炼了从全局视觉上下文派生出的紧凑型任务状态,然后用于生成任务条件专家对数。这些对数与令牌级对数结合,并通过本地专家库和任务无关残差库进行路由,然后进行任务特定预测。该框架旨在提高预测质量和计算效率,并计划在NYUD-v2和PASCAL-Context等数据集上使用Segment Anything Model 3和Vision Tra…

  7. TOOL · CL_216177 ·

    新框架使用 DINOv2 增强跨域目标检测

    研究人员开发了一个名为语义定位增强教师 (SLE-T) 的新框架,以使用视觉基础模型 (VFMs) 改进跨域目标检测。该方法解决了教师模型和学生模型之间的空间尺度差异和语义不兼容问题,以及源域训练的教师模型遗漏目标域对象的问题。SLE-T 框架利用轻量级的 SLE Adapter 和 DINOv2,增强了其识别能力,并确保了特征兼容性,从而实现更有效的知识转移。实验表明,SLE-T 在显著减少训练时间和计算资源的情况下,实现了最先进的性能。

  8. FRONTIER RELEASE · CL_127769 ·

    蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成

    蚂蚁集团凌波科技发布了一系列旨在推进具身AI和机器人技术的新模型。LingBot-VA 2.0被呈现为首个具身原生世界动作模型,从根本上为物理世界交互而设计,而非改编数字世界模型。与之相辅的是LingBot-World 2.0,一个能够进行长达一小时生成的实时交互式世界模型,并整合了AI代理机制以实现动态交互。此外,LingBot-Video,一个基于MoE的视频生成模型,针对具身AI任务进行了优化,在机器人基准测试中表现优于现有模型…

  9. TOOL · CL_106815 ·

    新框架支持数十亿参数Transformer模型的线性合并

    研究人员开发了一个新的框架,用于合并大型预训练Transformer模型,特别是那些拥有数十亿参数的模型。该方法通过同时优化两个模型端点的插值路径来解决先前方法的局限性,并使用双重学习过程来对齐它们。该技术在WikiText数据集上对中等参数语言模型表现出接近零损失的障碍,并在ImageNet上对Vision Transformer Large模型保持了高精度,这表明解决参数对称性可以实现大规模Transformer架构的可靠线性合并。

  10. RESEARCH · CL_98134 ·

    新研究探索合并大型Transformer模型和提高循环模型稳定性

    两篇新研究论文探索了增强大型Transformer模型能力和稳定性的新颖技术。第一篇论文介绍了一个可扩展的线性模式连接(LMC)框架,该框架允许合并数十亿参数的预训练Transformer,在WikiText上展示了接近零损耗的障碍,并保持了视觉Transformer在ImageNet上的高精度。第二篇论文研究了循环Transformer中的残差缩放,提出了一种新的缩放因子,该因子提高了可训练性,并允许在不同有效深度之间直接进行超参数…

  11. TOOL · CL_56285 ·

    新的Anatomy-Slot方法提高了视网膜诊断的准确性

    研究人员开发了一种名为Anatomy-Slot的新型无监督方法,用于分析视网膜图像,通过明确比较左右眼同源解剖结构来提高诊断准确性。该方法将图像块分解为不同的解剖区域,从而实现更鲁棒的双侧推理过程。在ODIR-5K数据集上,该方法比基线模型在AUC方面显著提高了4.2个百分点,为开发更符合临床实践的可解释诊断系统指明了方向。

  12. TOOL · CL_30593 ·

    Anatomy-Slot 方法通过模拟双侧结构改进视网膜诊断

    研究人员开发了一种名为 Anatomy-Slot 的新无监督视网膜诊断方法,该方法明确模拟了病情的双侧性质。通过将图像块分解为不同的槽并使用交叉注意力在双眼之间进行对齐,该技术旨在提高诊断准确性。在 ODIR-5K 数据集上的测试中,Anatomy-Slot 的 AUC 比标准的 ViT-L 基线提高了 4.2%,这表明明确的结构对应关系可以提高诊断性能。