PulseAugur
实时 07:08:12
实体 K-means++

K-means++

PulseAugur coverage of K-means++ — every cluster mentioning K-means++ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_171781 ·

    k-means++ 算法改进以提高近似比

    研究人员提出了一种对 k-means++ 算法的修改,k-means++ 是一种用于初始化 k-means 聚类的常用方法。标准算法对于固定数量的中心 k,其最坏情况下的期望近似比为 \Theta(\log k)。然而,当中心数量 k 从范围 \{K, \ldots, 2K-1\} 中均匀选择时,修改后的 k-means++ 算法能以恒定概率实现 O(1) 近似。

  2. RESEARCH · CL_145648 ·

    新的主动学习策略提高了稀有叫声的生物声学分类

    研究人员开发了一种名为 BADGE-Greedy-DPP 的新主动学习策略,用于生物声学叫声类型分类,该策略对于长尾和稀疏数据集特别有效。该方法贪婪地选择最大化梯度嵌入体积的片段,确保最优批次值的高比例。该方法还通过逐帧加权预测残差来解决时间粒度不匹配问题,使稀有叫声能够显著影响片段方向。在对斑鬣狗叫声数据集的实验中,BADGE-Greedy-DPP 在整体和稀有叫声类型性能方面均优于其他查询策略。

  3. TOOL · CL_135411 ·

    新的PLSCAN算法提供改进的多尺度密度聚类

    研究人员推出了一种新颖的多尺度密度聚类算法PLSCAN,用于探索性数据分析。PLSCAN通过采用基于持久性的聚类选择程序,解决了DBSCAN和HDBSCAN等现有密度聚类方法中的超参数选择难题。该方法识别跨越不同尺度的稳定聚类,与HDBSCAN*相比,在真实数据集上表现出更高的性能和稳定性,具体体现在更高的中位数ARI和更好的重采样稳定性。此外,在低维数据上,PLSCAN的运行时间与k-Means++相当。

  4. RESEARCH · CL_135111 ·

    新准则利用数据难度优化 k-means++ 重启

    研究人员为 k-means++ 算法开发了一种名为 GTRC 的新准则,用于确定最佳重启次数。该方法使用 Good-Turing 估计和置信区间,根据数据集难度动态调整重启次数,而不是依赖于任意固定的次数。在 36 个数据集上的测试表明,GTRC 在适当变化重启次数的同时实现了具有竞争力的聚类质量,提供了一种更具原则性的方法。

  5. TOOL · CL_128701 ·

    AI框架使用K-Means++聚类识别可疑交易模式

    研究人员开发了一个新的工具包,使用K-Means++聚类来检测资本市场中的可疑交易模式。该框架分析了2012年至2024年间约一百万笔金融交易的数据集,识别出2.02%的交易可能存在欺诈。识别出的可疑交易被分为操纵交易、金字塔骗局、内幕交易和假突破等类型,但由于缺乏真实数据,很大一部分仍未分类。该模型的有效性通过0.561的轮廓系数得到验证。

  6. RESEARCH · CL_06846 ·

    Lloyd算法在扰动样本下的聚类一致性已获证明

    研究人员分析了Lloyd算法(一种流行的无监督聚类方法)在应用于扰动数据时的收敛性。他们证明,即使存在小的扰动,只要初始化得当,该算法在对数次迭代后仍能保持误聚类率的指数界限。这一理论保证也适用于衡量派生聚类统计显著性的流水线,对网络分析和时间序列分析等领域的谱聚类应用具有启示意义。