Computer vision and pattern recognition
PulseAugur coverage of Computer vision and pattern recognition — every cluster mentioning Computer vision and pattern recognition across labs, papers, and developer communities, ranked by signal.
- instance of Vision--Language Models 90%
- instance of Influence Flower 70%
- instance of CatalyzeX Code Finder for Papers 70%
- instance of cs.CV 70%
- used by RGB color model 70%
- used by Vision--Language Models 70%
- instance of Diffusion Models 70%
- used by Diffusion Models 60%
- instance of arXivLabs 50%
- other arXivLabs 50%
13 天有情绪数据
-
新方法增强了精细文物的三维重建
研究人员开发了一种用于薄片状文物三维重建的新方法,解决了易碎性和共享特征有限等挑战。该几何约束双向点云配准技术结合了语义引导预处理、基于PCA的归一化和考虑厚度的配准策略。该方法利用估计的物理厚度作为约束来保持结构完整性,并通过评估多个全局旋转假设来解决旋转歧义,最终提高了精细文物数字化的准确性和可靠性。
-
AI检测植物病害受限于实验室数据集,审查发现
一篇新发表在arXiv上的综述文章分析了当前使用AI进行植物病害检测的状况,并指出了在实际应用中存在的关键差距。文章指出,大多数数据集是在实验室环境中生成的,缺乏农业田地中存在的环境多样性和真实条件。这种缺陷阻碍了AI模型的泛化能力和鲁棒性,导致在农民部署时表现不佳。该综述提出了一种评估数据集的分类方法,并强调需要采用多模态方法,将环境数据与视觉信息相结合,以改进精准农业。
-
新的攻击方法提高了闭源多模态大语言模型的对抗可迁移性
研究人员开发了一种名为IAU-FOA的新方法,以提高对抗性攻击对闭源多模态大语言模型(MLLMs)的有效性。该技术通过在全局和局部层面进行特征对齐来增强对抗性样本的可迁移性,解决了先前主要使用全局图像级特征的方法的局限性。IAU-FOA结合了置信度自适应不平衡传输进行细粒度特征对齐,以及视觉不变性增强,以确保对抗性扰动能够跨不同的视觉编码器泛化,在性能上优于现有方法。
-
新方法校正水下相机畸变,实现精确三维测绘
研究人员开发了一种新方法来校正由水下相机外壳引起的图像畸变。该技术在图像空间中应用,解决了影响三维重建和相机轨迹精度的“碗状”变形。这种基于物理的校正可与现有的运动恢复结构(SfM)和视觉SLAM算法一起使用,从而提高帧配准精度并减少真实世界数据集上的重投影误差。
-
新型SNAP模型通过新视角合成增强几何表示学习
研究人员开发了SNAP,一种新颖的自监督Transformer模型,可从新视角合成中改进几何表示学习。通过采用姿态条件局部解码器和潜在空间重建目标,SNAP避免了空间表达性解码器引起的表示稀释以及低级像素空间目标的特征学习限制。该模型在视觉定位、姿态估计和机器人操作等各种任务中表现出竞争力,尽管计算和数据需求较低,但仍优于一些监督方法。
-
新研究通过改进的语义和效率推进3D高斯溅射技术 · 已追踪6个来源
多篇研究论文正在探索3D高斯溅射(3DGS)技术的进步。其中一篇论文介绍了一种训练后方法,通过分离检测器、提升过程和表示转换中的错误来改进语义提升。另一篇论文提出了DensiTok,一个用于密集化内部几何令牌的模块,以使前馈3DGS模型能更有效地处理稀疏视图。此外,一种新方法侧重于3DGS的场景无关、以对象为中心的表示学习,旨在实现更好的泛化。最后,正在进行关于具有体积次表面散射的可重照明3DGS的研究,以及通过多分辨率层次结构实现实…
-
新的 3DROID 数据集通过 3D 高斯表示增强机器人操作能力
研究人员推出了 3DROID,这是一个旨在弥合机器人操作模型中 2D 观测与 3D 物理动作之间差距的新数据集。该数据集利用可渲染的 3D 高斯表示,但解决了在相机外参不可靠时保留真实世界度量尺度方面的局限性。通过提出一个锚定重建场景到机器人度量工作区的、感知校准的流水线,3DROID 增强了新视角保真度,并提供了对机器人操作研究至关重要的场景级可靠性信息。
-
新的层级高斯场方法改进了稀疏视图下的三维重建
研究人员推出了一种新颖的稀疏视图三维重建方法——层级高斯场(HierGF)。该方法通过将粗略的几何数据和二维生成先验转换为自监督信号,解决了匹配信息有限和物体结构不完整等挑战。HierGF 通过可学习的置信度网络和几何一致的致密化模块,增强了多视图一致性,并改善了欠采样区域的重建效果。
-
新方法利用相机运动来监督声音定位模型
研究人员开发了一种新颖的方法,通过利用自我运动作为监督信号来训练声音定位的音频模型。该方法利用视频中相机视角的改变来推断声源方向,然后用于训练音频模型。该系统将这种基于视觉自我运动的监督与传统的双耳线索相结合,展示了从真实世界数据中成功学习以及在声音定位任务上的强大性能。
-
新描述符精确分析3D形状,保留手性
研究人员开发了一种新的描述符,用于分析具有球形拓扑的3D形状,解决了现有方法的局限性。该描述符精确消除了对参数化、姿态和尺度的依赖,同时保留了标准方法会丢失的手性信息。新方法利用经典不变量理论中的多项式不变量,并通过基准测试进行了验证,成功地区分了解剖结构中的镜像对和非对称对。
-
新PAMI框架从文本生成人与物交互
研究人员开发了PAMI,一个用于从文本生成人与物交互的新颖框架。该方法采用部分锚定运动方法,其中身体部位锚点“投票”决定物体运动,灵感来源于霍夫变换。PAMI使用PamiVAE学习交互潜在空间,并以粗到精的层次结构生成交互,其中PamiGen创建初始交互,PamiRefiner解决细粒度的接触几何。在InterAct数据集上的实验表明,PAMI在生成忠实交互和准确的人与物相对运动方面表现优越,接触召回率比现有最先进方法高出14.5%。
-
新的对抗性攻击方法在图像生成中保留了主体完整性
研究人员开发了一种新的对抗性图像生成方法,该方法可以保留图像中主体的完整性。该技术引入了一个“载体”元素,即一个次要的视觉组件,它吸收了大部分对抗性攻击更新。这种方法可以实现强大的、可迁移的攻击,误导分类器,同时确保主要主体在视觉上保持完整并可供人类识别。
-
BTC3D框架增强图像到3D生成的细节
研究人员开发了BTC3D,一个新颖的框架,使用扩散模型增强图像到3D生成中的细节保留。这种无需训练的方法在推理时运行,从图像块中提取局部条件信号以对抗“细节衰减”。BTC3D通过动态条件调度整合全局和局部引导,在无需重新训练模型的情况下提高了纹理质量和视觉保真度。
-
新的图像编码方法优先考虑机器视觉性能
研究人员开发了一种名为“You've Seen Enough”的新型图像编码方法,该方法优先考虑机器视觉性能而非人类视觉质量。这种方法将图像压缩视为一个约束优化问题,确保预定义级别的人类观察质量,同时将剩余的比特分配给增强机器任务性能。与无约束基线相比,该方法实现了显著的比特率降低,证明了其在计算机视觉应用是视觉数据主要消费场景下的效率。
-
新的神经表示方法提升高光谱视频压缩性能
研究人员开发了一种使用隐式神经表示压缩高光谱视频的新颖方法。这种新方法显著优于传统的高光谱图像压缩技术,在峰值信噪比方面取得了实质性提升,并显著降低了数据速率。此外,压缩后的视频在目标跟踪等下游任务中表现出更好的性能,在低数据量场景下优于基于主成分分析和JPEG2000的方法。
-
研究表明AI模型难以检测多模态假新闻 · 追踪6个来源
新研究探讨了多模态大语言模型(MLLMs)在生成和检测假新闻方面的能力和局限性。研究表明,虽然MLLMs可用于创建跨各种领域的逼真虚假社交媒体帖子,但当前的检测模型在识别图像真实性方面,其准确性常常达不到人类水平。研究人员正在开发新的框架和数据集,通过考虑生成方面和证据关系来改进检测,同时也强调了在人工智能驱动的虚假信息检测工具中,人类判断和透明设计的重要性。
-
IRIS框架提供无姿态新视角合成
研究人员推出了IRIS,一个用于从无姿态多视角图像进行无姿态新视角合成的新框架。这种自监督方法平衡了隐式潜在空间渲染的灵活性与显式3D表示的几何基础。IRIS将场景表示为潜在神经场,并使用自预测的相机参数渲染新视图,实现了具有竞争力的质量和姿态准确性。
-
新的自适应曲线细分方法学习局部角度以改进几何体生成
研究人员开发了一种新的自适应插值曲线细分方法,该方法通过学习局部角度来改进几何体生成。与具有单一全局张力参数的传统方法不同,这种方法确保细分后的曲线通过控制点,同时适应变化的局部几何形状。与现有基线相比,该技术显著降低了最近邻误差,并降低了弯曲能量和切线粗糙度。
-
新的海森堡提升描述符提高了手写识别的准确性
研究人员开发了一种名为海森堡提升描述符的新描述符,以改进在线手写识别系统。与忽略笔画顺序的现有欧几里得描述符不同,这种新方法融入了方向信息。即使是简单地向现有描述符添加一个终端带符号面积标量,也能显著提高分类器的准确性,特别是对于笔画顺序至关重要的字符。一个更复杂的十五维扩展在嘈杂条件下和对于带有环的字符提供了进一步的提升。
-
新方法无需用户阈值即可检测图像中的孤立像素
研究人员开发了一种检测图像中孤立像素的新颖方法,这对于医学成像、天文学和质量控制等应用至关重要。现有的技术,如模板匹配和二阶导数方法,存在局限性,例如无法用于灰度图像或对噪声和用户定义的阈值高度敏感。新方法修改了具有对比度敏感感受野的神经元模型,结合了兴奋性和抑制性区域,无需用户指定的参数即可有效识别单像素偏差。