PulseAugur
实时 11:07:03
实体 Computer vision and pattern recognition

Computer vision and pattern recognition

PulseAugur coverage of Computer vision and pattern recognition — every cluster mentioning Computer vision and pattern recognition across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
43
90 天内 116
发布 · 30天
0
90 天内 0
论文 · 30天
43
90 天内 116
层级分布 · 90 天
主题
关系
情绪 · 30 天

19 天有情绪数据

最近 · 第 1/6 页 · 共 116 条
  1. TOOL · CL_212200 ·

    新模型预测手术视觉状态和器械轨迹

    研究人员开发了一种初步的联合视觉-轨迹世界动作模型,用于手术运动规划。该模型同时预测未来的视觉状态和器械轨迹,克服了单独方法的局限性。通过编码历史视频帧和工具轨迹,该模型在较短的预测范围内展示了更高的预测精度,优于直接的一次性预测。

  2. TOOL · CL_212022 ·

    Core-KAN:基于Kolmogorov-Arnold网络的连续视觉核发布

    研究人员推出Core-KAN,一种新颖的连续卷积算子,旨在增强计算机视觉任务。该算子基于Kolmogorov-Arnold网络,将几何尺度自适应与内容相关的滤波解耦,从而能够更灵活、更高效地处理各种分辨率下的图像特征。Core-KAN通过预测局部尺度并构建尺度条件核响应,在任意分辨率下合成空间滤波器,以最小的开销超越了现有的卷积和动态核基线。

  3. TOOL · CL_210633 ·

    用于路面缺陷识别的新3D深度学习架构

    研究人员开发了一种新颖的3D深度学习架构,用于利用探地雷达(GPR)数据识别路面缺陷。该方法通过整合RGB图像与GPR扫描来有效标记缺陷,解决了标注数据集稀缺的问题。提出的卷积神经网络(CNN)结合了残差连接、混合核大小和注意力机制,以提高特征表示和分类精度,用于检测路面裂缝和修补区域。

  4. RESEARCH · CL_210198 ·

    新TDIR算法增强历史图像检索

    研究人员开发了时间可分解图像表示(TDIR),这是一种旨在改进历史照片图像和对象检索的新型算法。TDIR通过使用正交子空间将图像分解为独立的时间和内容组件来工作,这种方法在特定条件下已被数学证明是可行的。这种方法允许在嵌入空间上进行传递操作,从而在无监督的情况下将一个图像的时间信息注入另一个图像,并提供了一种更直观的方式来浏览照片档案,同时在日期估计和对象检索方面保持有竞争力的性能。

  5. TOOL · CL_206597 ·

    新框架加速视听生成模型

    研究人员开发了一个新框架,用于加速视听生成模型,这些模型目前由于重复的注意力计算而计算成本高昂。他们的方法称为同步感知稀疏注意力,在加速过程中识别并保留音频和视频分支之间的关键交互。该方法在保持视频质量、音频质量和视音频同步的高保真度的同时,提高了推理效率。

  6. TOOL · CL_206157 ·

    新方法解决了皮肤病学AI的图像选择问题

    研究人员引入了一项名为可靠输入选择的新任务,以提高远程皮肤病学中皮肤病学模型的准确性。这些模型经常在分布变化方面遇到困难,即患者提交的图像在光照、角度和焦点方面与训练数据不同。所提出的方法旨在从给定病例的多个提交图像中选择最有可能被正确分类的图像。虽然理想的预言机可以将加权F1分数提高约20个百分点,但实际的无训练数据选择器,如嵌入范数或模型置信度,只能恢复一小部分增益。

  7. TOOL · CL_204118 ·

    新框架以弧秒级精度估计相机平台运动

    研究人员开发了一种新颖的框架,用于估计视觉测量中相机平台的相对运动,特别是在控制场不完整或缺失的情况下。该方法直接从图像位移和已知的3D点计算帧间平台运动,无需非线性优化或初始姿态估计。该框架展示了最先进的精度,在只有一个控制点的情况下实现了2.97弧秒的旋转RMSE和1.19毫米的平移RMSE,同时保持了计算效率,平均运行时间为0.46毫秒。

  8. TOOL · CL_204004 ·

    扩散模型框架应对复杂的InSAR相位解缠挑战

    研究人员开发了一种利用扩散模型的新型相位解缠框架,以应对InSAR处理中的挑战,特别是针对地震等大规模复杂事件。该新方法旨在处理由地表断层引起的突然位移不连续和相位跳变,而这些问题常常阻碍传统算法。与先前受限于固定输入尺寸的学习方法不同,该框架可以有效地处理大型InSAR图像,并在合成和真实数据集上都展示了其实用性。

  9. RESEARCH · CL_206605 ·

    新研究探讨扩散图像模型的缩放定律和训练策略

    研究人员发表了多篇探讨扩散模型在图像生成方面进展的论文。其中一项研究“Abra: Scaling Diffusion Image Training”详细介绍了文本到图像扩散模型的缩放定律的系统分析,发现它们比语言模型需要更多的数据才能实现最佳训练,并且对过度训练具有鲁棒性。另一篇论文研究了像素空间扩散模型,提出了一种潜在到像素的策略,该策略可以加速收敛并提高推理速度。此外,关于“TINA+”的研究探讨了未学习扩散模型中的残余视觉知识,…

  10. TOOL · CL_200275 ·

    对比度指标有望客观评估历史手稿修复质量

    研究人员探索了使用基于对比度的图像质量测量方法来客观评估重建历史手稿的可读性和质量。使用公开数据集进行的两个实验表明,基于对比度的指标,特别是潜在对比度和对比度噪声比,分别与专家人类评分和全参考质量评估高度相关。这些发现表明,对比度指标可以作为评估应用于文化遗产文件的数字修复技术有效性的可靠指标。

  11. RESEARCH · CL_203668 ·

    Marionette模型将游戏世界状态与外观合成分离

    研究人员开发了Marionette,一种用于交互式游戏的新型世界模型,它将显式状态预测与外观合成分离开来。这种方法模拟了一个276维的3D世界状态,包括关节骨骼和轨迹,然后由一个固定的渲染器用于几何渲染,一个扩散模型用于照片级真实感外观。Marionette展示了对预测世界状态的直接可控性,并通过对显式状态施加规则,能够修复长时程不一致性,例如角色之间距离过远或穿透地形。

  12. TOOL · CL_198246 ·

    视觉模型可以解读雷达显示屏以评估空中交通复杂性

    研究人员已经证明了使用视觉模型来解读雷达显示屏以估计空中交通复杂性的可行性。尽管雷达图像具有独特的视觉特征,例如稀疏的飞机斑块和自相似性,但一个 Vision Transformer (ViT) 模型经过训练,在回归复杂性组件方面取得了高精度。该模型的性能,特别是其根据飞机对复杂性的贡献而移除飞机时的比例响应,表明雷达图像是基于深度学习的空中交通建模的可行输入。

  13. TOOL · CL_196202 ·

    新方法利用事件相机增强AI视频帧插值

    研究人员开发了一个新颖的基于适配器的框架,将事件相机数据集成到预训练的图像到视频扩散模型中,以改进视频帧插值。该方法利用图像扭曲事件(IWEs)和双向稀疏光流来指导扩散过程,减少伪影并增强时间连贯性。该方法旨在利用事件相机的高时间分辨率运动线索,而无需对现有扩散模型进行完全重新训练,并在基准测试中表现出卓越的性能。

  14. TOOL · CL_195908 ·

    深度神经网络展现出对新物体方向的涌现泛化能力

    研究人员提出了证据,表明深度神经网络(DNN)能够泛化到识别训练数据中不存在的物体方向。这种能力似乎随着训练中使用的熟悉物体的数量增加而增强,特别是当这些物体以熟悉方向的二维旋转形式呈现时。研究表明,这种泛化是由对熟悉和不熟悉物体之间共同特征进行调整的神经元促进的,表明存在类似大脑的神经机制在起作用。

  15. TOOL · CL_194074 ·

    新框架增强了在各种退化条件下的红外小目标检测

    研究人员开发了DAISOD,一个旨在改进红外小目标检测的新框架,特别是在雾或不均匀性等退化条件下。该框架首先识别图像退化的类型和严重程度,然后通过专门的分支调整其处理,最后融合结果进行检测。一个关键特性是其物理引导的恢复机制,它使用物理模型来估计和去除退化效应,而不会过度改变小目标。该团队还创建了一个新的数据集来测试该框架在各种退化场景下的性能,证明了其与现有方法相比的优越性能。

  16. TOOL · CL_194017 ·

    FreCast框架通过两阶段强度精炼改进降水临近预报

    研究人员开发了FreCast,一个新颖的两阶段框架,旨在通过精炼雷达回波强度预测来改进降水临近预报。第一阶段生成初始预报,第二阶段利用此预报的空间结构来校正个别地点的强度偏差。在三个数据集上的实验表明,FreCast在更长的预报时效内持续提高预报技能指标,并更好地保持雨带连续性和强降水结构。

  17. TOOL · CL_194002 ·

    新框架 ASV3D 通过额外图像增强 3D 对象重建

    研究人员开发了 ASV3D,这是一个旨在通过引入额外图像来增强单视图 3D 对象重建的新框架。该框架提供了两种适应策略:一种是无需重新训练即可改进重建的零样本方法,另一种是使用对比学习进行优化以获得更好的视觉保真度和跨视图一致性。当应用于现有的单视图重建管道时,ASV3D 在基准数据集和真实世界数据集上均持续展现出更高的准确性和鲁棒性,优于基线方法。

  18. TOOL · CL_193998 ·

    新的EvBS框架通过事件引导模糊合成改进运动去模糊

    研究人员开发了EvBS,一种用于运动去模糊的新型框架,它解决了由域偏移引起的性能下降问题。EvBS通过解耦运动和视觉内容来合成多样化的训练对,并利用事件相机的高时间分辨率。该方法通过内在和外在模糊合成策略增强了现有去模糊模型在未见数据集上的鲁棒性。

  19. TOOL · CL_193976 ·

    视觉与WiFi结合,增强物体属性估计

    研究人员开发了ViWi,一个整合计算机视觉和WiFi信号以估计物体体积力学性质的新框架。该方法通过用聚合证据并连贯预测属性的材料槽来表示物体,解决了仅视觉估计的固有歧义。通过引入源自WiFi频段模拟的射频(RF)描述符,ViWi获得了超越视觉外观的全局组成线索,从而提高了属性估计的准确性和物理连贯性。

  20. TOOL · CL_193899 ·

    新的审计工具EndoClock标记医学AI管道中的数据丢失

    研究人员开发了EndoClock,这是一种新的审计工具,旨在识别医学世界模型中潜在的信息丢失。这些模型通常通过将多模态记录同步到固定速率的网格上来进行预处理,如果观测时钟是内生的,这可能会无意中抹去关键证据。EndoClock对可能保留基本证据的位置进行分类——在采样值、网格单元更新模式、原生计时或外部采集通道中——并报告支持的最低表示形式或指示未解决的问题。该工具使用超声心动图突出了这个问题,其中B模式视频数据在多普勒采集过程中丢失…