DBSCAN
PulseAugur coverage of DBSCAN — every cluster mentioning DBSCAN across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的图-Transformer模型提升3D关键点检测性能
研究人员开发了一种新颖的3D关键点检测方法,该方法将学习到的抑制模块与由方向图神经网络增强的Point Transformer骨干网络相结合。该方法旨在通过直接学习识别和精炼关键点来改进传统的启发式后处理步骤。与DBSCAN和贪婪非极大值抑制相比,该模型表现出更优越的性能,并在KeypointNet和Building3D等基准测试中取得了最先进的成果。
-
新研究证明聚类算法固有的NP难性
一篇研究论文引入了通用聚类问题(UCP),以统一和解释各种聚类算法中固有的计算难度。该研究通过从图着色和精确三集覆盖中进行归约,证明了UCP是NP难的。通过将包括k-means、DBSCAN和谱聚类在内的十种常见聚类范式映射到UCP,该论文表明这些方法继承了这种根本性的棘手性,为观察到的故障模式提供了理论基础。
-
神经形态 DBSCAN 算法扩展至时空数据
研究人员为神经形态 DBSCAN 算法开发了时空扩展,该算法建立在先前“扁平”和“脉动”结构的基础上。这些新的扩展旨在更有效地利用事件传感器数据的时空特征。该工作还探索了分段实现,通过利用时间来进一步优化空间,尤其是在硬件资源有限的情况下。所有网络结构都以开源实现的形式提供。
-
NVIDIA cuML 和 RAPIDS 在 GPU 上加速机器学习工作流
本教程演示了如何使用 NVIDIA 的 cuML 和 RAPIDS 库通过 GPU 加速来实现机器学习工作流。它涵盖了设置 GPU 环境、使用 cuML 加速 scikit-learn 工作负载,以及利用原生 cuML API 与 CuPy 和 cuDF 直接互操作。该指南包括对 PCA、K-Means、逻辑回归和随机森林等各种算法的 CPU 和 GPU 性能进行基准测试,以及使用 UMAP、t-SNE 和 HDBSCAN 构建基于 …
-
仅基于 LiDAR 的锥形检测框架可在 CPU 上运行以实现无人驾驶赛车
研究人员为 FSAE 无人驾驶赛车开发了一个轻量级的、仅基于 LiDAR 的感知系统,该系统可在 CPU 上高效运行。该系统利用随机森林分类器、地面移除、基于 IMU 的运动补偿和 DBSCAN 聚类来检测锥形。通过分析特征重要性,该系统被优化为仅使用 7 个特征,在保持高性能的同时降低了输入复杂度。该流程实现了 98.33% 的 F1 分数和 3.13 毫秒的运行时间,并发布了配套的数据集和工具以供复现。
-
AI框架分析城市出行和土地利用相互作用
研究人员开发了先进的AI框架来分析城市出行模式及其与土地利用的相互作用。一项研究提出了一个GeoAI混合框架,集成了MGWR、Random Forest和ST-GCN来模拟不同交通模式的交通流,实现了高精度并优于基准。另一种方法使用一个具有不确定性感知和物理信息感知的框架,从聚合计数推断出行起点-终点矩阵,减少对个体追踪的依赖,并实现更具可部署性的城市智能。
-
机器学习优化6G波束赋形,侧重网络特征
本研究论文探讨了机器学习技术在6G网络波束赋形优化中的应用。研究比较了监督和无监督机器学习方法,分析了网络、环境、设备和视觉数据等各种特征组。结果表明,网络特征对波束赋形优化更具预测性,而聚类分析显示部署环境和设备类型是场景分组的关键因素。论文还强调了带宽、物联网传感器和移动性对特征重要性的影响,并建议未来的工作涉及深度学习和强化学习。
-
新研究探讨k-means聚类的不相容性与平衡性
Adam Quinn Jaffe和Pollard的一篇新arXiv论文研究了k-means聚类的细微差别,特别是在总体分布具有有限期望而非有限方差的情况下。研究强调,即使总体层面的中心存在,经验k-means聚类中心也可能不收敛,这是由极端聚类不平衡和离群样本引起的微妙之处。该论文还提出通过确保经验聚类之间一定程度的平衡来恢复渐近相容性的方法。
-
新的 K-SCAN 算法为大数据聚类提供线性复杂度
一种名为 K-SCAN 的新型聚类算法已被开发出来,旨在解决大数据时代传统方法的扩展性挑战。这种混合算法结合了初步的向量量化和基于密度的结构分析,以实现线性计算复杂度,使其比 BIRCH 等现有算法快得多。K-SCAN 在识别非线性簇方面表现出对噪声的鲁棒性和高精度,尽管它可能难以处理过度平滑和分离密度差异巨大的簇。
-
新的深度学习模型MORDEN推动了太阳纤维检测的进展
研究人员开发了一种新的深度学习工作流程,用于自动检测太阳纤维,解决了多尺度特征提取和数据稀缺的挑战。该系统命名为MORDEN,专注于多尺度特征提取,并通过DenseCRF和DBSCAN进行后处理。该工作流程成功生成了一个名为AHAS的大型高质量数据集,实验结果表明MORDEN在太阳纤维语义分割方面优于现有模型。
-
UMAP和DBSCAN增强电子健康记录中的乳腺癌数据聚类
研究人员开发了一种新的方法,利用电子健康记录中的乳腺癌数据进行无监督聚类分析。该方法结合了用于降维的均匀流形逼近与投影(UMAP)和DBSCAN聚类算法。该组合方法的有效性通过DBCV、DCSI和DISCO等统计指标进行了验证,证明了其识别具有医学意义的患者群体的潜力。
-
自组织映射:一种被低估的聚类算法
本文探讨了聚类算法,重点关注自组织映射(SOMs)及其被低估的潜力。作者主张深入研究SOMs,认为调整它们可以带来显著的好处,这与通常基于调整不当而表现不佳而将其忽略的普遍做法相反。文章将SOMs与其他算法如DBSCAN、k-means和高斯混合模型进行了对比。
-
新的RAGU引擎使用紧凑型LLM提升GraphRAG性能
研究人员推出RAGU,一个开源引擎,旨在通过采用多步知识图谱构建过程来改进Graph Retrieval-Augmented Generation (GraphRAG)。与单通道系统不同,RAGU将实体提取与整合分开,利用DBSCAN等技术进行去重,并使用Leiden社区检测进行图谱构建。一项关键创新是开发了Meno-Lite-0.1,一个针对语言技能优化的紧凑型7B参数模型,其在知识图谱构建方面的表现优于Qwen2.5-32B等大型…
-
新的PLSCAN算法提供改进的多尺度密度聚类
研究人员推出了一种新颖的多尺度密度聚类算法PLSCAN,用于探索性数据分析。PLSCAN通过采用基于持久性的聚类选择程序,解决了DBSCAN和HDBSCAN等现有密度聚类方法中的超参数选择难题。该方法识别跨越不同尺度的稳定聚类,与HDBSCAN*相比,在真实数据集上表现出更高的性能和稳定性,具体体现在更高的中位数ARI和更好的重采样稳定性。此外,在低维数据上,PLSCAN的运行时间与k-Means++相当。
-
大型语言模型(LLMs)在新研究中增强软件漏洞分类能力
一篇新研究论文探讨了高级主题建模技术(特别是利用大型语言模型 LLMs 的技术)在软件漏洞分类中的应用。该研究使用了 BERTopic、Top2Vec、CombinedTM 和 Mixtral 等模型,以及 UMAP 和 HDBSCAN 等聚类方法。通过分析漏洞数据集的“威胁”特征,该研究旨在通过自动化和可扩展的解决方案来加强网络安全中的威胁优先级排序和决策制定。
-
新研究解决多语言LLM毒性检测与缓解问题
两篇新研究论文探讨了在大型语言模型(LLM)中检测和缓解毒性的方法,特别关注多语言环境。第一篇论文调查了跨不同语言识别和减少有害输出的现有策略,强调了语言覆盖不均和有害定义具有文化特异性等挑战。第二篇论文介绍了ToxSearch-S,一种分布式进化搜索算法,旨在寻找引发毒性响应的对抗性提示,并通过MPI实现和改进的毒性检测与现有方法相比,展示了效率的提升。
-
新的 CDL 指标改进了无监督聚类验证
研究人员引入了一个名为中心描述长度 (CDL) 的新聚类验证指标。该指标旨在改进无监督机器学习任务中聚类算法和超参数的选择,尤其适用于复杂数据集。CDL 基于簇内紧密度以及估计的簇中心和协方差来评估分区,在不需要真实标签的情况下提供了描述长度的概率上限。在合成数据集和图像数据集上的测试表明,CDL 在识别正确簇数量和获得更高的调整兰德指数 (Adjusted Rand Index) 分数方面优于传统指标。
-
新的 ExDBSCAN 方法为聚类提供反事实解释
研究人员开发了 ExDBSCAN,这是一种新的事后解释方法,旨在解决聚类中的可解释性差距,特别是对于 DBSCAN 算法。该方法提供反事实解释,详细说明数据点为何被分配到特定簇或被归类为噪声。ExDBSCAN 采用一种感知密度的方法,并结合受物理学启发的模型来生成多样化且邻近的解释,在众多数据集上与现有基线相比,表现出优越的性能和有效性。
-
WordDetectorNet 使用像素回归和 DBSCAN 进行单词检测
一种新的手写单词检测方法 WordDetectorNet,结合了逐像素边界框回归和 DBSCAN 聚类。与基于锚点检测和非极大值抑制等传统方法不同,该模型将每个像素分类为“单词像素”,并回归其边界框的距离。然后使用具有 1-IoU 距离度量的 DBSCAN 对数千个重叠的候选框进行聚类,并选择每个聚类的中值框作为最终检测结果。
-
DBSCAN算法发现数据中的隐藏模式
DBSCAN是一种聚类算法,它识别数据点的密集区域以发现任意形状。它将紧密聚集的点分组在一起,并将异常值标记为噪声。这种方法在寻找具有不同密度和复杂结构的数据集中的簇方面特别有效。