PulseAugur
中
实时 10:23:42
实体 hdbscan

hdbscan

PulseAugur coverage of hdbscan — every cluster mentioning hdbscan across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
20
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
17
90 天内 17
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 22 条
  1. TOOL · CL_257217 ·

    新的InfoTaxa方法改进了用于生物多样性的无标签视觉聚类

    研究人员开发了InfoTaxa,一种用于视觉嵌入的无标签聚类的新方法,以辅助细粒度视觉分类,特别是在生物多样性监测方面。虽然使用BioCLIP特征与UMAP和HDBSCAN的现有方法在科和属级别显示出潜力,但在物种级别上却停滞不前。InfoTaxa通过引入信息校准指标并使用DNA数据作为审计信号来解决这个问题,揭示了物种级别的聚类受到聚类方法和视觉表示本身的限制。研究表明,虽然改进的聚类可能会揭示更多结构,但它不能单独弥合DNA数据所…

  2. TOOL · CL_254530 ·

    AI微调以适应真实的放射学报告风格

    研究人员开发了一种方法,以提高AI生成的放射学报告与人类放射学家所写报告在风格上的一致性。通过分析CheXpert Plus数据集中的2000份报告,他们识别出五种不同的报告模式。然后,他们采用了逆向宪法AI框架,使用这些风格惯例对MedGemma-4B模型进行微调,从而在BLEU-4和ROUGE-L等文本一致性指标上取得了显著改进。

  3. TOOL · CL_250564 ·

    NVIDIA cuML 和 RAPIDS 在 GPU 上加速机器学习工作流

    本教程演示了如何使用 NVIDIA 的 cuML 和 RAPIDS 库通过 GPU 加速来实现机器学习工作流。它涵盖了设置 GPU 环境、使用 cuML 加速 scikit-learn 工作负载,以及利用原生 cuML API 与 CuPy 和 cuDF 直接互操作。该指南包括对 PCA、K-Means、逻辑回归和随机森林等各种算法的 CPU 和 GPU 性能进行基准测试,以及使用 UMAP、t-SNE 和 HDBSCAN 构建基于 …

  4. TOOL · CL_215774 ·

    无监督网络流量分类使用 HDBSCAN 和 K-Means

    本文详细介绍了一种无监督网络流量分类方法,用于区分在单个自治系统编号 (ASN) 下运行的不同消费品牌。该方法利用了网络层信号,如 DNS 解析器 IP、IP 范围和会话计数,这些信号通常被标准的 IP-to-ISP 数据库所忽略。通过采用特征工程技术,如通配符 IP 清理、前缀提取以及对偏斜数值数据的日志转换,作者为 HDBSCAN 和 K-Means 等聚类算法准备数据,以便在没有预先存在训练数据的情况下分配品牌标签。

  5. TOOL · CL_199970 ·

    AI管道将IT工单数据转化为可操作的智能

    一篇新的研究论文概述了一个社会技术AI管道,该管道旨在将IT服务管理(ITSM)工单数据转化为可操作的智能,供销售和高管利益相关者使用。该管道利用基于LLM的模式规范化、HDBSCAN和层次凝聚聚类来创建层次主题。与销售工程和客户成功专业人士进行的评估表明,在可解释性、可操作性、信任度和使用可能性方面得分很高,将ITSM分析定位为信息系统内以人为本的设计问题。

  6. TOOL · CL_180913 ·

    AI框架从显微镜图像中提取丰富的嵌入

    研究人员开发了一个AI框架,用于从颗粒和纤维的光学显微镜图像中提取语义丰富的图像嵌入。该系统使用一个多模态教师,将视觉嵌入与文本嵌入相结合,以描述照明、放大倍率和样本特征。一个学生视觉Transformer被训练成仅从图像中重建这些嵌入,在伪类别验证和样本描述检索方面取得了高精度。

  7. TOOL · CL_173236 ·

    Apple ML Research 将图算法应用于UMAP的内部kNN图

    Apple Machine Learning Research 发表了一篇论文,详细介绍了标准图算法如何应用于Uniform Manifold Approximation and Projection (UMAP) 构建的内部k近邻(kNN)图。该方法旨在通过利用UMAP投影扭曲数据流形之前的图表示来增强数据理解能力。研究表明,PageRank、k-core分解和聚类系数等算法可以有效地识别代表性数据点、密集区域和紧密连接的邻域,为样…

  8. COMMENTARY · CL_151034 ·

    自组织映射:一种被低估的聚类算法

    本文探讨了聚类算法,重点关注自组织映射(SOMs)及其被低估的潜力。作者主张深入研究SOMs,认为调整它们可以带来显著的好处,这与通常基于调整不当而表现不佳而将其忽略的普遍做法相反。文章将SOMs与其他算法如DBSCAN、k-means和高斯混合模型进行了对比。

  9. TOOL · CL_135411 ·

    新的PLSCAN算法提供改进的多尺度密度聚类

    研究人员推出了一种新颖的多尺度密度聚类算法PLSCAN,用于探索性数据分析。PLSCAN通过采用基于持久性的聚类选择程序,解决了DBSCAN和HDBSCAN等现有密度聚类方法中的超参数选择难题。该方法识别跨越不同尺度的稳定聚类,与HDBSCAN*相比,在真实数据集上表现出更高的性能和稳定性,具体体现在更高的中位数ARI和更好的重采样稳定性。此外,在低维数据上,PLSCAN的运行时间与k-Means++相当。

  10. RESEARCH · CL_135123 ·

    UMAP的内部kNN图解锁新的数据分析技术

    一篇新的研究论文探讨了均匀流形逼近与投影(UMAP)内部生成的、未被充分利用的k近邻(kNN)图。该研究展示了如何将PageRank、k-core分解和聚类系数等标准图算法应用于该图,以增强数据分析。这些方法揭示了代表性数据点、密集核心区域和紧密社区,为现有技术提供了互补的见解。

  11. TOOL · CL_129229 ·

    新的RES-DARE框架增强了入侵检测系统的安全性和鲁棒性

    研究人员推出了一种新颖的RES-DARE框架,旨在增强动态网络环境中入侵检测系统(IDS)的鲁棒性和安全性。该系统将误分类视为适应的信号而非丢弃,从而应对分布变化和不断演变的攻击行为的挑战。RES-DARE集成了几个组件,包括监督对比编码器、故障缓冲区机制和信任风险监视器,以实现自适应IDS行为。一个关键特性是AEHM-v2,一种回滚安全修复机制,只有在性能指标保持或提高时才提交适应,否则回滚到稳定状态。在CICIDS2017、UNS…

  12. TOOL · CL_128908 ·

    新的HASSL框架增强了细胞显微镜的自监督学习能力

    研究人员开发了一个名为HASSL的新自监督学习框架,旨在更好地捕捉图像数据中的层级结构,特别是在单细胞显微镜领域。该框架解决了现有模型因过度关注成像模态等粗粒度因素而可能抑制细粒度细节的问题。HASSL采用了一个包含分割教师的蒸馏框架,并使用HDBSCAN进行层级感知对比损失,以改善决策边界和形态学感知。在对20个显微镜数据集中的230万个单细胞语料库进行测试时,HASSL在准确性和下游任务性能方面均有所提高,包括基于细胞形态的药物分…

  13. TOOL · CL_128868 ·

    大型语言模型(LLMs)在新研究中增强软件漏洞分类能力

    一篇新研究论文探讨了高级主题建模技术(特别是利用大型语言模型 LLMs 的技术)在软件漏洞分类中的应用。该研究使用了 BERTopic、Top2Vec、CombinedTM 和 Mixtral 等模型,以及 UMAP 和 HDBSCAN 等聚类方法。通过分析漏洞数据集的“威胁”特征,该研究旨在通过自动化和可扩展的解决方案来加强网络安全中的威胁优先级排序和决策制定。

  14. TOOL · CL_121134 ·

    AI 管道破译了古代 Inka Khipus 的结构模式

    研究人员开发了一个机器学习管道来分析 Inka Khipus,这是 Inka 帝国用于记录的打结绳索设备。通过从 619 个 khipus 的数据库中工程化结构特征,他们采用了无监督聚类来识别三个不同的组,并采用监督分类来准确识别 Inka 晚期地平线帝国风格。分析显示,绳索扭转方向是帝国 khipus 的关键结构特征,有趣的是,一个聚类主要由 19 世纪的欧洲博物馆藏品组成,这表明殖民实践被编码在数据中。

  15. TOOL · CL_115656 ·

    研究论文提出新的新鲜度检测方法,应对时间 RAG 的挑战

    一篇新研究论文探讨了在时间数据中检测趋势的挑战,特别是在检索增强生成 (RAG) 系统中。作者(包括 Matthew Grofsky)为 RAG 提出了一种轻量级、与模型无关的时间层。他们的工作将数据新鲜度和主题演变的问题分开,并以网络安全数据 (NVD CVE) 作为测试案例。该论文强调了当前启发式跟踪方法的局限性,并提供了一个可重现的框架来解耦这些时间方面。

  16. TOOL · CL_105677 ·

    LLM 应用于 HDBSCAN 文本聚类

    本文探讨了大型语言模型(LLM)在典型聊天界面之外的应用,重点关注它们在非结构化文本聚类中的使用。文章详细介绍了如何将 LLM 嵌入与 HDBSCAN 等算法结合,对相似的文本数据进行分组,为分析大量文本提供了一种实用的方法。

  17. TOOL · CL_96127 ·

    AI流水线自动化汽车软件测试规范生成

    研究人员开发了一种新颖的“集群然后总结”流水线,用于自动化大规模汽车软件需求测试规范的生成。该方法嵌入需求,使用UMAP和HDBSCAN进行聚类,然后总结每个集群以保留关键信息。该流水线在单个需求和集群级集成点生成测试,与标准的LLM方法相比,提高了覆盖率和效率。

  18. TOOL · CL_86864 ·

    AI 识别 BDD 测试套件中的重构候选

    研究人员开发了一种新颖的方法来识别和分类行为驱动开发 (BDD) 测试套件中的重构机会。通过采用机器学习分类器和大型语言模型 (LLM) 裁判,该系统可以检测重复的步骤子序列,评估其提取的适用性,并将它们映射到特定的重构模式。这种方法旨在自动化改进公共 Gherkin 生态系统中 BDD 测试代码的可维护性和可重用性。

  19. TOOL · CL_43486 ·

    LLM 评估工具已更新,支持生产数据和对抗性测试

    提出了一种评估大型语言模型(LLM)的新方法,以解决静态评估工具无法检测模型回归的问题。该方法包括每周使用真实的生产追踪数据刷新评估数据集,并按意图集群进行分层抽样,以确保代表性。此外,一个永久性的对抗性数据集,该数据集是从表明模型故障的实际客户支持票证中精心挑选出来的,在评估过程中被赋予很高的权重,以优先考虑实际性能。

  20. TOOL · CL_32714 ·

    新框架可检测社交媒体上的操纵性政治叙事

    研究人员开发了一个新框架,用于检测和分类社交媒体上发现的操纵性政治叙事。该系统首先使用带有推理模型的少样本提示,从合法的批评中过滤掉操纵性帖子。然后,使用UMAP进行降维,并使用HDBSCAN进行无监督聚类,以识别没有预定义类别的不同叙事组。该方法应用于超过120万条社交媒体帖子,成功发现了41个独特的操纵性叙事集群。