Vít
PulseAugur coverage of Vít — every cluster mentioning Vít across labs, papers, and developer communities, ranked by signal.
- developed alphaXiv 90%
- developed Gotit.pub 90%
- developed ScienceCast 90%
- instance of Swin Transformer 90%
- instance of Vision Transformers 90%
- instance of Data Efficient Image Transformers 90%
- used by DagsHub 70%
- used by ScienceCast 70%
- used by alphaXiv 70%
- instance of alphaXiv 70%
- used by Gotit.pub 70%
- developed CatalyzeX 70%
10 天有情绪数据
-
本地 RAG 工具 TraceFind 可检测代码库中的文档谎言
Angellina Joyce Paul 开发了 TraceFind,一个本地检索增强生成(RAG)系统,旨在识别代码文档与实际实现之间的差异。该工具索引代码库和文档,使用户能够用自然语言提问,并获得带有精确文件和行号引用的答案。TraceFind 的一个关键功能是能够检测并报告文档说明与底层代码之间的矛盾,确保开发者的准确性。
-
新型适配器改进了从脑信号中检索图像的功能
研究人员开发了一种名为 RPA(残差块-令牌适配器)的新型适配器,旨在改进从脑电图 (EEG) 和脑磁图 (MEG) 脑信号中检索图像的功能。该适配器通过利用 Vision Transformer (ViT) 编码器中间层的全部块令牌来工作,与仅使用单个全局嵌入的方法相比,保留了更丰富的视觉信息。实验表明,保留所有块令牌对于 EEG 对齐至关重要,而 CLS 令牌提供的独特信息最少。RPA 系统在 THINGS-EEG2 和 THIN…
-
基于空间重叠的高光谱图像分类易受数据泄露影响
一篇新的研究论文强调了高光谱图像分类中的一个关键问题:由基于块的采样中的空间重叠引起的数据泄露。当训练和测试数据来自同一图像,而未考虑空间邻近性时,性能指标可能会显著膨胀。在Pavia University数据集上使用包括3D-CNN和ViT在内的各种模型进行的实验表明,当正确处理空间采样时,这种泄露会导致准确率下降超过40个百分点。研究还发现,增加块大小会加剧重叠问题,这凸显了在高光谱图像分析中采用严谨评估方法的必要性。
-
新的STAMP框架增强了AI在医学图像分析中的时间感知能力
研究人员开发了STAMP,一种新颖的随机孪生掩码自编码器(Stochastic Siamese Masked Autoencoder)框架,旨在提高AI模型在分析纵向医学图像中的时间感知能力。与确定性方法不同,STAMP引入了随机过程,以更好地捕捉疾病随时间进展的固有不确定性。该框架在OCT和MRI数据集上进行了评估,与现有的时间感知MAE方法和基础模型相比,在预测年龄相关性黄斑变性和阿尔茨海默病进展方面表现出优越的性能。
-
Stockfish 国际象棋引擎的价值函数被提炼到神经网络中
一个项目已成功将 Stockfish 国际象棋引擎的价值函数提炼到一个神经网络模型中,该模型采用了 ResNet 和 Vision Transformer 架构。这个提炼后的模型在一个包含十亿个国际象棋局面(来自 Lichess 游戏)的海量数据集上进行了训练,并且完整的 39 亿个局面数据集已在 Hugging Face 上提供。该研究旨在创建一个比 Stockfish 本身更快的完整搜索树近似模型,有可能与现有的 NNUE 模型竞争。
-
新论文发现AI训练数据的价值取决于学习者
一项新的研究论文探讨了训练数据样本的价值并非绝对,而是取决于所使用的特定机器学习模型。实验表明,改变模型的架构,例如增加其宽度或改变其输入处理方式,可以显著改变哪些数据样本被认为对训练最有价值。这表明数据选择策略必须针对目标学习者进行定制,而不是依赖于通用规则。
-
DA360模型通过尺度不变性增强360度深度估计
研究人员开发了DA360,这是Depth Anything V2模型的全景适应版本,用于改进360度深度估计。该新框架利用了现有的DAV2模型的零样本泛化能力,并采用了轻量级适应过程。DA360从ViT类令牌中学习每张图像的偏移量,以实现尺度不变监督,并将循环填充集成到DPT解码器中以消除接缝伪影,从而获得更准确的3D点云和更好的空间一致性。
-
新研究强调图像编码器的“表征风险”
一篇新研究论文提出了预训练图像编码器中的“表征风险”概念,证明了不同的编码器可能导致下游预测任务的结果显著不同。该研究评估了包括SigLIP 2、ResNet50和DINOv2在内的十种编码器,应用于预测房价、赛马表现和医学诊断等各种场景。研究结果表明,没有一种编码器是普遍最优的,而一个涉及在锁定数据上进行基准测试和验证的建议工作流程可以提高预测性能和不确定性报告,该工作流程已在LOOKAGAIN-ML软件包中实现。
-
FAST Transformer 模型利用视觉基础模型进行图像匹配
研究人员推出了一种新颖的对应模型 Flow Any Scene Transformer (FAST),该模型旨在实现精确的图像匹配。FAST 利用单视图视觉基础模型的洞察,特别是它们的查询-键投影,来初始化一个基于 ViT 的匹配器。这种方法使得模型能够随着单视图模型的进步而扩展,而无需专门的成对中心预训练。FAST 采用零参数重布线策略将自注意力层转换为交叉注意力,以实现视图间的交互,并在一个包含 600 万对图像的数据集上进行了训…
-
TRACE框架使用射频测量实现无线数字孪生的自校准
研究人员开发了TRACE,一个使用射频测量来自校准无线数字孪生的新框架。该系统解决了现有数字孪生中的不准确性,这些不准确性通常源于不完美的3D环境模型。TRACE通过射线追踪孪生、反投影测量和模拟的射频数据以及提取建筑物周围的局部区域来对齐物理世界和数字孪生之间的残差误差。然后,一个多视图校正器融合证据,预测建筑物参数的校正,从而显著提高位置和方向的准确性。
-
Flow Any Scene Transformer (FAST) 通过重用视觉模型先验知识来推进跨视图匹配
研究人员推出了一种新颖的对应模型 Flow Any Scene Transformer (FAST),该模型旨在通过利用单视图视觉基础模型的洞察力来改进跨视图匹配。FAST 将这些预训练模型的查询-键投影用作跨视图匹配的可重用先验。通过将自注意力层转换为交叉注意力层,并采用零参数重布线策略,FAST 可以在不进行专门的成对中心预训练的情况下,随着单视图模型的进步而扩展。该模型在各种基准测试中都展示了最先进的性能,并显示出随着骨干网络大…
-
HyperSAM:高光谱遥感的新基础模型
研究人员开发了HyperSAM,一个用于高光谱遥感的新型基础模型。该模型通过从多光谱图像合成高分辨率高光谱立方体并使用伪掩码进行监督,解决了现有数据集的局限性。HyperSAM利用了冻结的Segment Anything Model 3 (SAM3)架构,并针对高光谱数据进行了调整,包括一个可训练的编码器和一个专家混合掩码精炼器。实验证明了其在各种遥感任务中的有效性,表明高质量的合成数据可以优于嘈杂的真实世界监督。
-
无人机音频分类:方法扩展胜过模型扩展
一篇新的研究论文探讨了在无人机(UAV)上进行音频分类时,模型大小与微调方法之间的权衡。研究发现,参数高效微调(PEFT)方法,特别是对EfficientNet-B7等大型模型进行选择性batch-norm调整,在更新极少部分参数的情况下达到了高精度。对于这项特定任务,轻量级卷积神经网络在准确性和效率方面普遍优于Transformer,这表明在数据稀缺的情况下,对于无人机音频分类而言,优化微调方法比简单地扩展模型架构更为关键。
-
CNN-Transformer混合模型在乳腺癌检测中达到99%的准确率
研究人员开发了一种新颖的深度学习模型,该模型集成了卷积神经网络(CNN)和紧凑型卷积Transformer(CCT),以改进乳腺癌的乳腺X线摄影检测和分类。这种混合方法采用CNN集成的CCT分词器,旨在捕捉医学图像中的局部特征和长距离依赖关系,克服了传统CNN的局限性。该模型比ViT更轻量级,参数量少,在三个数据集上均实现了近乎完美的准确率,并集成了可解释AI(XAI)以增强临床信任度。
-
MAST框架通过自训练增强生物多样性声音检测
研究人员开发了MAST,一个用于生物多样性监测中高效鲁棒的声音检测的新框架。该方法结合了掩码音频预训练、轻量级检测器以及在无标签数据上的迭代自训练。MAST在识别不同环境下的动物叫声方面表现出显著的改进,包括印度尼西亚的热带雨林和西班牙的地中海鸟类栖息地,即使在分布发生变化的情况下也能有效识别。
-
循环式 vs. 堆叠式Transformer:心电图分类比较
研究人员对循环式和堆叠式Transformer编码器进行了机制比较,重点关注其在12导联心电图分类上的应用。该研究在PTB-XL数据集上训练了两个模型:bViT(一种循环式Transformer)和一个标准的ViT。尽管参数减少了8.9倍,bViT仍取得了与ViT相当的准确率,表明其参数效率。虽然两种架构生成的潜在表征相似,但它们的动态却显著不同,bViT显示出更小的步长,并且对单个患者的敏感度较低。
-
新方法应对AI模型测试时适应挑战 · 跟踪2个来源
研究人员开发了机器学习模型测试时适应的新方法。第一种方法MASA使用多模态大型语言模型来锚定语义描述,有助于打破模型在适应不断变化的数据分布时出现的自我参照错误循环。第二种方法TestDG侧重于持续测试时适应,旨在使模型能够泛化到未来未见的领域,同时保留先前领域的知识。两种方法在相关基准测试中均显示出有希望的结果。
-
CLFTv2:高效的相机-激光雷达融合用于自动驾驶
研究人员推出CLFTv2,一个用于自动驾驶语义分割的高级框架,可高效融合相机和激光雷达数据。该新模型用基于Swin的编码器和轻量级残差解码器取代了全局ViT注意力,在2D视角域操作以整合多尺度几何线索。CLFTv2在多个数据集上展示了对弱势道路使用者的召回率的提高,在ZOD和Waymo上取得了高mIoU分数,同时比以前的模型更具计算效率。
-
预训练和蒸馏在细胞分类中优于架构选择
一篇新发表在arXiv上的研究调查了不同深度学习架构在无标签单细胞分类中的有效性。研究发现,预训练和微调策略比架构选择(如CNN与Vision Transformers (ViTs))更关键。具体来说,预训练模型即使参数更少,也显著优于从头开始训练的模型。研究还强调,知识蒸馏可以为实际部署带来更高效、性能更好的紧凑型模型。
-
AudioFuse 结合 ViT 和 1D CNN 实现稳健的心音图分类
研究人员开发了 AudioFuse,这是一种结合了 Vision Transformer (ViT) 和 1D 卷积神经网络 (CNN) 模型的心音图 (PCG) 分类新架构。这种混合方法同时从生物医学音频信号的光谱和时间数据表示中学习。在 PhysioNet 2016 数据集上,AudioFuse 取得了 0.8608 的具有竞争力的 ROC-AUC,优于其单独的基线模型。该架构在 PASCAL 数据集上还表现出对域迁移的卓越鲁棒性…