hdbscan
PulseAugur coverage of hdbscan — every cluster mentioning hdbscan across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
无监督网络流量分类使用 HDBSCAN 和 K-Means
本文详细介绍了一种无监督网络流量分类方法,用于区分在单个自治系统编号 (ASN) 下运行的不同消费品牌。该方法利用了网络层信号,如 DNS 解析器 IP、IP 范围和会话计数,这些信号通常被标准的 IP-to-ISP 数据库所忽略。通过采用特征工程技术,如通配符 IP 清理、前缀提取以及对偏斜数值数据的日志转换,作者为 HDBSCAN 和 K-Means 等聚类算法准备数据,以便在没有预先存在训练数据的情况下分配品牌标签。
-
AI管道将IT工单数据转化为可操作的智能
一篇新的研究论文概述了一个社会技术AI管道,该管道旨在将IT服务管理(ITSM)工单数据转化为可操作的智能,供销售和高管利益相关者使用。该管道利用基于LLM的模式规范化、HDBSCAN和层次凝聚聚类来创建层次主题。与销售工程和客户成功专业人士进行的评估表明,在可解释性、可操作性、信任度和使用可能性方面得分很高,将ITSM分析定位为信息系统内以人为本的设计问题。
-
AI框架从显微镜图像中提取丰富的嵌入
研究人员开发了一个AI框架,用于从颗粒和纤维的光学显微镜图像中提取语义丰富的图像嵌入。该系统使用一个多模态教师,将视觉嵌入与文本嵌入相结合,以描述照明、放大倍率和样本特征。一个学生视觉Transformer被训练成仅从图像中重建这些嵌入,在伪类别验证和样本描述检索方面取得了高精度。
-
Apple ML Research 将图算法应用于UMAP的内部kNN图
Apple Machine Learning Research 发表了一篇论文,详细介绍了标准图算法如何应用于Uniform Manifold Approximation and Projection (UMAP) 构建的内部k近邻(kNN)图。该方法旨在通过利用UMAP投影扭曲数据流形之前的图表示来增强数据理解能力。研究表明,PageRank、k-core分解和聚类系数等算法可以有效地识别代表性数据点、密集区域和紧密连接的邻域,为样…
-
自组织映射:一种被低估的聚类算法
本文探讨了聚类算法,重点关注自组织映射(SOMs)及其被低估的潜力。作者主张深入研究SOMs,认为调整它们可以带来显著的好处,这与通常基于调整不当而表现不佳而将其忽略的普遍做法相反。文章将SOMs与其他算法如DBSCAN、k-means和高斯混合模型进行了对比。
-
新的PLSCAN算法提供改进的多尺度密度聚类
研究人员推出了一种新颖的多尺度密度聚类算法PLSCAN,用于探索性数据分析。PLSCAN通过采用基于持久性的聚类选择程序,解决了DBSCAN和HDBSCAN等现有密度聚类方法中的超参数选择难题。该方法识别跨越不同尺度的稳定聚类,与HDBSCAN*相比,在真实数据集上表现出更高的性能和稳定性,具体体现在更高的中位数ARI和更好的重采样稳定性。此外,在低维数据上,PLSCAN的运行时间与k-Means++相当。
-
UMAP的内部kNN图解锁新的数据分析技术
一篇新的研究论文探讨了均匀流形逼近与投影(UMAP)内部生成的、未被充分利用的k近邻(kNN)图。该研究展示了如何将PageRank、k-core分解和聚类系数等标准图算法应用于该图,以增强数据分析。这些方法揭示了代表性数据点、密集核心区域和紧密社区,为现有技术提供了互补的见解。
-
新的RES-DARE框架增强了入侵检测系统的安全性和鲁棒性
研究人员推出了一种新颖的RES-DARE框架,旨在增强动态网络环境中入侵检测系统(IDS)的鲁棒性和安全性。该系统将误分类视为适应的信号而非丢弃,从而应对分布变化和不断演变的攻击行为的挑战。RES-DARE集成了几个组件,包括监督对比编码器、故障缓冲区机制和信任风险监视器,以实现自适应IDS行为。一个关键特性是AEHM-v2,一种回滚安全修复机制,只有在性能指标保持或提高时才提交适应,否则回滚到稳定状态。在CICIDS2017、UNS…
-
新的HASSL框架增强了细胞显微镜的自监督学习能力
研究人员开发了一个名为HASSL的新自监督学习框架,旨在更好地捕捉图像数据中的层级结构,特别是在单细胞显微镜领域。该框架解决了现有模型因过度关注成像模态等粗粒度因素而可能抑制细粒度细节的问题。HASSL采用了一个包含分割教师的蒸馏框架,并使用HDBSCAN进行层级感知对比损失,以改善决策边界和形态学感知。在对20个显微镜数据集中的230万个单细胞语料库进行测试时,HASSL在准确性和下游任务性能方面均有所提高,包括基于细胞形态的药物分…
-
大型语言模型(LLMs)在新研究中增强软件漏洞分类能力
一篇新研究论文探讨了高级主题建模技术(特别是利用大型语言模型 LLMs 的技术)在软件漏洞分类中的应用。该研究使用了 BERTopic、Top2Vec、CombinedTM 和 Mixtral 等模型,以及 UMAP 和 HDBSCAN 等聚类方法。通过分析漏洞数据集的“威胁”特征,该研究旨在通过自动化和可扩展的解决方案来加强网络安全中的威胁优先级排序和决策制定。
-
AI 管道破译了古代 Inka Khipus 的结构模式
研究人员开发了一个机器学习管道来分析 Inka Khipus,这是 Inka 帝国用于记录的打结绳索设备。通过从 619 个 khipus 的数据库中工程化结构特征,他们采用了无监督聚类来识别三个不同的组,并采用监督分类来准确识别 Inka 晚期地平线帝国风格。分析显示,绳索扭转方向是帝国 khipus 的关键结构特征,有趣的是,一个聚类主要由 19 世纪的欧洲博物馆藏品组成,这表明殖民实践被编码在数据中。
-
研究论文提出新的新鲜度检测方法,应对时间 RAG 的挑战
一篇新研究论文探讨了在时间数据中检测趋势的挑战,特别是在检索增强生成 (RAG) 系统中。作者(包括 Matthew Grofsky)为 RAG 提出了一种轻量级、与模型无关的时间层。他们的工作将数据新鲜度和主题演变的问题分开,并以网络安全数据 (NVD CVE) 作为测试案例。该论文强调了当前启发式跟踪方法的局限性,并提供了一个可重现的框架来解耦这些时间方面。
-
LLM 应用于 HDBSCAN 文本聚类
本文探讨了大型语言模型(LLM)在典型聊天界面之外的应用,重点关注它们在非结构化文本聚类中的使用。文章详细介绍了如何将 LLM 嵌入与 HDBSCAN 等算法结合,对相似的文本数据进行分组,为分析大量文本提供了一种实用的方法。
-
AI流水线自动化汽车软件测试规范生成
研究人员开发了一种新颖的“集群然后总结”流水线,用于自动化大规模汽车软件需求测试规范的生成。该方法嵌入需求,使用UMAP和HDBSCAN进行聚类,然后总结每个集群以保留关键信息。该流水线在单个需求和集群级集成点生成测试,与标准的LLM方法相比,提高了覆盖率和效率。
-
AI 识别 BDD 测试套件中的重构候选
研究人员开发了一种新颖的方法来识别和分类行为驱动开发 (BDD) 测试套件中的重构机会。通过采用机器学习分类器和大型语言模型 (LLM) 裁判,该系统可以检测重复的步骤子序列,评估其提取的适用性,并将它们映射到特定的重构模式。这种方法旨在自动化改进公共 Gherkin 生态系统中 BDD 测试代码的可维护性和可重用性。
-
LLM 评估工具已更新,支持生产数据和对抗性测试
提出了一种评估大型语言模型(LLM)的新方法,以解决静态评估工具无法检测模型回归的问题。该方法包括每周使用真实的生产追踪数据刷新评估数据集,并按意图集群进行分层抽样,以确保代表性。此外,一个永久性的对抗性数据集,该数据集是从表明模型故障的实际客户支持票证中精心挑选出来的,在评估过程中被赋予很高的权重,以优先考虑实际性能。
-
新框架可检测社交媒体上的操纵性政治叙事
研究人员开发了一个新框架,用于检测和分类社交媒体上发现的操纵性政治叙事。该系统首先使用带有推理模型的少样本提示,从合法的批评中过滤掉操纵性帖子。然后,使用UMAP进行降维,并使用HDBSCAN进行无监督聚类,以识别没有预定义类别的不同叙事组。该方法应用于超过120万条社交媒体帖子,成功发现了41个独特的操纵性叙事集群。
-
LLM助力城市桥梁重要性评分与图分析聚类
研究人员开发了一种使用异构图分析和大型语言模型评估城市桥梁重要性的新方法。该方法基于来自开放数据源的交通通达性、医院邻近性和供应链影响等因素量化桥梁的重要性。然后,系统利用聚类技术识别不同城市的功能性桥梁原型,并采用LLM(特别是Elyza8b)自动生成与政策相关的解释。
-
研究人员探索说话人识别 AI 中的分层聚类
研究人员开发了新的方法来理解用于说话人识别的 AI 模型内部的工作原理。通过应用 SLINK 和 HDBSCAN 等分层聚类算法,他们发现 AI 学习到的表征形成了结构化的分层组,而不是简单的独立簇。创建了一种新算法,分层簇-类匹配 (HCCM),用于将这些分层组映射到特定的说话人特征,如性别或地区口音,并引入了一个新指标 Liebig 分数来评估这些映射的准确性。