PulseAugur
实时 11:01:43
实体 Cross Attention Network for Few-shot Classification

Cross Attention Network for Few-shot Classification

PulseAugur coverage of Cross Attention Network for Few-shot Classification — every cluster mentioning Cross Attention Network for Few-shot Classification across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_247823 ·

    新型算子学习方法加速SDE采样

    研究人员开发了一种新颖的方法,通过将算子学习与流方法相结合,从随机微分方程(SDE)的不变测度中进行高效采样。该方法训练一个神经采样器,将SDE系数函数映射到所需的不变测度,在初始训练阶段后显著降低新实例的成本。该框架利用拉格朗日轨迹传感器和交叉注意力机制来处理高维问题,与传统的MCMC方法相比,在准确性和速度方面均具有竞争力,尤其是在混合缓慢的SDE方面。

  2. TOOL · CL_239431 ·

    DeepONets:注意力机制对求解PDE的准确性至关重要

    研究人员对深度算子网络(DeepONets)进行了一项受控研究,以了解各种注意力机制对其性能的影响。该研究系统地评估了五种具有不同注意力配置的DeepONet变体,包括交叉注意力、自注意力以及分词(tokenization),分别在数据驱动和物理信息训练场景下进行。结果表明,结合了交叉注意力的每传感器分词显著降低了多个基准问题的误差率,其中查询依赖的交叉注意力被证明是最可靠的机制。

  3. RESEARCH · CL_233390 ·

    新框架创建亚细胞分辨率单细胞嵌入

    研究人员开发了一种新颖的多模态框架来创建亚细胞分辨率单细胞嵌入。该方法整合了RNA表达谱、蛋白质序列数据和蛋白质结构信息。通过利用交叉注意力架构,该框架模拟了不同亚细胞区室内的相互作用,与以往将细胞整体处理的方法相比,提供了更精细的细胞表示。

  4. TOOL · CL_231703 ·

    IT-TextFusion框架通过迭代精炼增强文本引导的图像融合

    研究人员推出了一种新颖的文本引导图像融合框架IT-TextFusion,它增强了多模态信息的集成。该方法在多个阶段利用迭代式文本-图像交互和文本条件特征融合,以提高对复杂退化的鲁棒性。通过引入交叉注意力、交叉门融合和文本条件调制,IT-TextFusion旨在提供退化感知的语义条件,同时保留不同模态的互补信息。实验表明,该框架提高了信息保留和感知质量指标,尽管在某些指标上存在权衡。

  5. RESEARCH · CL_206642 ·

    FLEET方法推动事件相机强化学习发展

    研究人员开发了FLEET(通过高效令牌化从事件中学习特征),这是一种专为事件相机在强化学习任务中设计的新型特征提取方法。与先前将事件数据聚合到网格或依赖轨迹数据进行预训练的方法不同,FLEET直接处理事件序列。通过利用随机傅里叶特征和交叉注意力,它将可变事件流压缩为固定大小的潜在表示,将计算成本与传感器分辨率解耦,并实现端到端学习。FLEET在一个新的高吞吐量事件驱动强化学习基准上展示了最先进的性能和更高的鲁棒性。

  6. TOOL · CL_169826 ·

    WHTMix 使用 Walsh-Hadamard 变换进行高效立体深度估计

    研究人员开发了 WHTMix,一种新颖的立体深度估计方法,它利用 Walsh-Hadamard 变换进行高效的 token 混合。该方法将 transformer 模型中计算成本高昂的自注意力机制替换为对数线性成本替代方案,在保持精度的同时显著降低了运行时间和模型计算量。WHTMix 方法在自动驾驶和机器人等高分辨率立体匹配任务中特别有效,并包含一个混合对数视差损失函数,可在没有额外计算开销的情况下提高对远处物体的精度。

  7. TOOL · CL_115673 ·

    新理论解释Whisper模型中的AI幻觉

    一篇新的研究论文引入了光谱敏感性定理来解释大型自动语音识别(ASR)模型中的幻觉。该定理预测了一个相变,模型从信号衰减转变为秩-1崩溃。该理论在Whisper模型上进行了测试,结果显示中间版本经历了结构分解,而较大的模型则进入了一个寻求压缩的吸引子状态,使其与声学证据脱钩。

  8. TOOL · CL_93120 ·

    新框架对齐 CT 和 EHR 数据以改进事件发生时间预测

    研究人员开发了一个新的跨模态表示对齐框架,用于利用 CT 成像和纵向电子健康记录 (EHR) 改进事件发生时间 (TTE) 预测。这种由基础模型驱动的方法通过在共享的潜在空间中通过各种融合策略对齐数据,解决了模态不平衡和分布偏移等挑战。该框架在不同 TTE 任务的预测准确性方面表现出一致的改进,特别是在肺栓塞死亡率方面,对比多模态融合显示出稳健的结果。

  9. TOOL · CL_25789 ·

    VIMCAN网络融合Mamba和注意力机制,实现实时三维人体姿态估计

    研究人员开发了VIMCAN,一种新颖的用于视觉-惯性三维人体姿态估计的混合网络。该架构集成了Mamba的高效序列建模能力和交叉注意力机制的空间推理能力,以融合RGB关键点和IMU数据。VIMCAN在TotalCapture和3DPW等基准测试中取得了最先进的准确性,优于基于Transformer的方法,同时还能在消费级硬件上实现超过60 FPS的实时推理。

  10. TOOL · CL_16050 ·

    新框架增强了具有时空感知的AI模拟

    研究人员开发了一个新框架,以增强用于物理模拟的机器学习模型,特别解决了当前训练范式中的局限性。他们的方法引入了用于空间一致性的多节点预测、用于稳定性的使用交叉注意力的时域校正机制,以及用于捕捉旋转对称性的具有旋转位置嵌入的几何归纳偏置。这些创新在多种架构和数据集上进行了评估,显示出在准确性和稳定性方面的一致改进,尤其是在长期预测方面。