Uniform Manifold Approximation and Projection
PulseAugur coverage of Uniform Manifold Approximation and Projection — every cluster mentioning Uniform Manifold Approximation and Projection across labs, papers, and developer communities, ranked by signal.
- competes with t-Distributed Stochastic Neighbor Embedding 70%
- instance of principal component analysis 70%
- used by hdbscan 70%
- instance of Gotit.pub 60%
- used by Fashion-MNIST 60%
- instance of alphaXiv 60%
- instance of CatalyzeX 60%
- used by t-Distributed Stochastic Neighbor Embedding 50%
- other t-Distributed Stochastic Neighbor Embedding 50%
- used by principal component analysis 50%
- competes with principal component analysis 50%
9 天有情绪数据
-
新论文提出使用精确率-召回率指标来验证降维技术
一篇新论文介绍了一个精确率-召回率框架,用于评估降维(DR)技术,特别关注它们在数据可视化中保留簇结构的能力。所提出的指标评估DR的关系阶段,量化模型相似性与预期簇标签之间的一致性。该方法旨在加速超参数调优,识别投影伪影,并确认是否捕获了底层的簇结构,从而使DR过程更有效和可靠。
-
新的SHOPCA方法通过几何洞察增强降维
研究人员开发了一种名为SHOPCA(基于形状算子的主成分分析)的新颖方法,用于无监督度量学习和降维。该技术通过使用平均形状算子正则化协方差矩阵,将微分几何信息整合到标准PCA框架中。一个单一的混合系数 alpha 控制着方差和曲率之间的平衡,从而实现可调的嵌入。该方法还包括一个基于谱特征间隙的无监督准则来选择 alpha,该准则在不需要类别标签的情况下最大化特征值的分离。SHOPCA 已在超过 50 个基准数据集上进行了评估,与 PC…
-
深度学习框架从史前手印中解码性别
研究人员开发了一个新颖的深度学习框架,旨在确定创作史前手印的个体的生理性别。这个不确定性感知的系统通过明确建模和传播不确定性来应对缺乏真实标签和人口差异等挑战。该方法包括图像处理、轮廓提取以及来自多个神经网络的集成预测,并通过流形映射和可解释人工智能技术进行验证。
-
TabSOM方法通过提高可解释性来增强表格数据的深度学习能力
研究人员开发了TabSOM,一种将表格数据编码为图像表示的新方法,以增强深度学习模型的应用。与仅考虑单个特征值的先前方法不同,TabSOM利用自组织映射(SOMs)来捕捉特征值及其相互关系。该方法在各种二元分类数据集上,与十二种现有的表格到图像技术相比,表现出了优越的性能和可解释性。
-
新的CosMAP方法改进了复杂数据的降维
研究人员开发了CosMAP,一种新的无监督降维方法,旨在为复杂、高维数据集创建忠实且可解释的嵌入。CosMAP通过结合余弦相似性邻域和对比亲和力来扩展UMAP框架,并通过吸引-排斥目标进行优化。该方法包括一个两阶段的精炼过程,首先学习一个中间高维表示来重建邻域图并初始化最终的低维嵌入。在包括手写数字、单细胞RNA测序数据和谱系信息在内的数据集上的评估表明,与现有的最先进方法相比,CosMAP产生了更连贯的视觉表示、更好的邻域保持和更清…
-
新研究探索用于二进制程序聚类的自监督学习
一项新研究探索了自监督学习(SSL)和表格表示学习(TRL)在二进制程序聚类中的应用,这是网络安全中用于恶意软件分析的关键任务。该研究在 Ember 和 Bodmas 数据集上分两个阶段进行,发现像 BYOL 和 SimSiam 这样的改编的基于视觉的 SSL 模型表现与监督方法相当。在无监督学习中,VIME 模型设定了新的最先进水平,而一种称为 VIME-R 的检索增强扩展进一步改进了它,通过更具信息量的训练对增强了恶意软件分析。
-
图神经网络增强高熵氧化物材料性质预测
研究人员探索了使用图神经网络(GNNs)预测高熵钙钛矿氧化物(HEPOs)的性质,这是一类复杂的材料。该研究调查了有序到无序迁移学习,将从化学有序钙钛矿中获得的知识应用于预测HEPOs的形成能和HOMO-LUMO能隙。结果表明,形成能预测有效迁移,而HOMO-LUMO能隙预测由于对局部化学环境的敏感性而表现出有限的可迁移性。纳入少量HEPO特异性数据集显著提高了HOMO-LUMO能隙预测,并且在GNN模型中包含三体几何信息增强了对复杂…
-
新的DiRe框架增强了用于全局结构保持的降维方法
开发了一个名为DiRe的新框架用于降维,旨在保持全局结构和同调特征。该方法结合了初始嵌入和基于图的布局优化,并使用局部失真、上下文保持和持久同调等度量来评估其有效性。DiRe与UMAP和tSNE等现有方法相比,提供了不同的权衡,通过Betti曲线和持久性图更侧重于可量化的宏观几何。
-
新的FloDR方法利用归一化流提供可逆降维
研究人员推出了一种新颖的可逆降维方法FloDR,该方法利用了归一化流。与t-SNE和UMAP等传统方法在优化过程中丢弃信息不同,FloDR保留了所有坐标。这使得可以进行精确的逆运算和密度计算,从而实现更准确的诊断可视化,例如条件散布图和隐藏对比度场。这些可视化是从模型的精确逆运算计算得出的,能够更可靠地理解数据的结构和信息保留情况。
-
Apple ML Research 将图算法应用于UMAP的内部kNN图
Apple Machine Learning Research 发表了一篇论文,详细介绍了标准图算法如何应用于Uniform Manifold Approximation and Projection (UMAP) 构建的内部k近邻(kNN)图。该方法旨在通过利用UMAP投影扭曲数据流形之前的图表示来增强数据理解能力。研究表明,PageRank、k-core分解和聚类系数等算法可以有效地识别代表性数据点、密集区域和紧密连接的邻域,为样…
-
B2B电子商务交易预测框架通过DiCE和PyPARC提高精度
一篇新论文介绍了一个用于预测B2B电子商务中交易倾向的框架,解决了传统方法(如SMOTE)难以应对的异构买家行为带来的挑战。所提出的方法利用多样化反事实解释(DiCE)生成合成数据,提高了比SMOTE更好的分布保真度。此外,它还采用了PyPARC框架进行校准的倾向概率,从而能够将客户细分为风险等级。该架构在一个大型B2B电子商务平台上进行评估,在0.8的决策阈值下达到了93.1%的精度,显著优于基于SMOTE的基线。
-
无监督方法为古语生成有效的句子嵌入
研究人员开发了两种无监督学习策略,TSDAE 和对比句子嵌入 (CSE),为古语创建有效的句子嵌入。这些方法仅使用原始文本来调整现有语言模型,在拉丁语和古希腊语文本的复用识别和对应检索等任务上,其表现优于多语言和专业基线。调整后的编码器即使在处理嘈杂的自动转录文本时也特别有效,并且有一个名为 Paraphrasis 的工具可供非专业人士使用完整的流程。
-
UMAP和DBSCAN增强电子健康记录中的乳腺癌数据聚类
研究人员开发了一种新的方法,利用电子健康记录中的乳腺癌数据进行无监督聚类分析。该方法结合了用于降维的均匀流形逼近与投影(UMAP)和DBSCAN聚类算法。该组合方法的有效性通过DBCV、DCSI和DISCO等统计指标进行了验证,证明了其识别具有医学意义的患者群体的潜力。
-
论文警告 t-SNE 和 UMAP 在可视化分析中被广泛滥用
一篇新发表在 arXiv 上的论文强调了 t-SNE 和 UMAP 等降维技术在可视化分析中被广泛滥用。研究表明,从业者经常误解这些工具,尽管它们在准确反映原始距离方面存在局限性,但仍被用来推断簇间关系。这种滥用似乎源于用户对降维原理缺乏全面理解,而以往纠正这一问题的学术努力已被证明无效。
-
掩码自编码器以91.3%的准确率学习钢材缺陷识别
研究人员开发了一种新颖的无监督方法,使用基于Transformer的掩码自编码器来识别钢材表面缺陷。该方法通过掩盖75%的输入块并对其进行重构,从大量的无标签图像中学习表示,实现了0.92的结构相似性得分和0.47的均方误差。然后使用UMAP和Agglomerative聚类对学习到的特征进行聚类,最终在六种已知缺陷类别上实现了91.3%的匈牙利匹配准确率。
-
新的模块化方法增强数据可视化透明度
研究人员开发了一种新的数据可视化模块化方法,该方法首先对数据进行聚类,然后单独嵌入每个聚类,最后对这些聚类进行对齐以创建全局嵌入。与t-SNE和UMAP等可能扭曲全局数据几何的现有技术相比,该方法旨在提高透明度。所提出的方法在各种合成和真实世界数据集上都表现出具有竞争力的性能。
-
新的机器学习方法NESS改进单细胞数据分析
研究人员开发了NESS,一种旨在改进单细胞数据表示的新机器学习方法。该方法建立在可预测性-可计算性-稳定性(PCS)框架之上,以解决现有邻域嵌入算法(如t-SNE和UMAP)的局限性,这些算法可能引入失真和伪影。NESS旨在提供更稳定、更具可解释性的嵌入,从而能够从嘈杂的高维单细胞测序数据中稳健地推断出平滑的生物结构和发育轨迹。
-
UMAP的内部kNN图解锁新的数据分析技术
一篇新的研究论文探讨了均匀流形逼近与投影(UMAP)内部生成的、未被充分利用的k近邻(kNN)图。该研究展示了如何将PageRank、k-core分解和聚类系数等标准图算法应用于该图,以增强数据分析。这些方法揭示了代表性数据点、密集核心区域和紧密社区,为现有技术提供了互补的见解。
-
无监督AI模型可学习敏感属性,侵犯公平性
研究人员证明,即使在训练数据中排除了年龄和收入等敏感属性,无监督机器学习表征仍可能无意中编码这些属性。一种名为SOMtime的新方法,基于自组织映射,表明这些敏感属性在嵌入中作为主要的潜在轴出现,与隐藏数据高度相关。这表明“不知情即公平”的方法在表征层面是不够的,需要对机器学习管道的无监督组件进行公平性审计。
-
EntroPath:新的流形学习方法使用路径集成
研究人员推出了一种新颖的流形学习方法 EntroPath,旨在从数据图中重建测地几何。该方法利用扩散路径的集成,特别是采用最大熵随机游走(MERW)来聚合路径,而不是依赖于单条轨迹或最短路径距离。EntroPath 在合成流形和单细胞基准测试中表现出优越的性能,尤其是在采样密度不均和分支轨迹明显的情况下,与现有的基于扩散和最短路径的技术相比,它能更准确地保留测地几何。