k-means clustering
PulseAugur coverage of k-means clustering — every cluster mentioning k-means clustering across labs, papers, and developer communities, ranked by signal.
- instance of spectral clustering 90%
- used by alphaXiv 70%
- used by Gotit.pub 70%
- used by ScienceCast 70%
- instance of alphaXiv 70%
- used by CatalyzeX 70%
- instance of Gotit.pub 70%
- instance of CatalyzeX 70%
- used by IArxiv 70%
- competes with hierarchical clustering 70%
- competes with Gaussian Mixture Models 70%
- instance of Birch 70%
10 天有情绪数据
-
基于图的WiFi轨迹分析在楼层分离中达到68.97%的准确率
研究人员开发了一种新颖的基于图的方法,利用WiFi信号数据区分多层室内环境中的楼层。该方法从WiFi指纹及其转换构建图,然后使用Node2Vec创建嵌入,并使用k-means进行聚类以识别不同的楼层。该方法在Huawei University Challenge 2021数据集上达到了68.97%的准确率,优于传统算法。该团队已公开提供数据集和代码,以促进室内定位的进一步研究。
-
更精简的Transformer模型可高效学习K-Means聚类算法
研究人员开发了一种更高效的Transformer模型,能够执行k-means聚类的Lloyd算法。与之前的迭代相比,该新模型所需的嵌入尺寸更小,降低了计算需求。该研究还探讨了在各种聚类任务上训练这些Transformer模型,使用随机梯度分析它们的收敛性和泛化能力,并研究它们的性能限制。
-
Mixture-of-Experts 模型在加密货币交易中表现好坏参半
一项新的研究论文探讨了在加密货币订单执行中使用混合专家(MoE)模型,特别考察了训练稳定性和故障模式。研究发现,虽然在 Binance 的 BTC/USDT 数据上,与标准的双深度 Q-学习(DDQL)相比,MoE 架构在平均执行缺口方面没有显著改善,但它们确实有助于抑制策略崩溃。然而,研究人员认为,退火探索(annealed exploration)而非专家划分(expert partitioning)是防止这些崩溃的主要因素,这表…
-
新研究探讨了大型语言模型的道德推理轨迹和情境化道德
研究人员正在探索大型语言模型(LLM)如何处理道德推理和情境。一项研究引入了“道德推理轨迹”来分析LLM在决策过程中如何在不同的伦理框架之间切换,发现这些轨迹可能不稳定且容易受到攻击。另一篇论文提出了COMETH框架,该框架将概率情境学习与LLM相结合,以模拟情境如何影响行为的可接受性,旨在实现比端到端LLM提示更具可解释性的道德AI。
-
新的 BalLOT 方法利用最优传输增强了平衡 k-均值聚类
研究人员推出了一种新颖的平衡 k-均值聚类方法 BalLOT,该方法利用最优传输。该方法旨在提供快速有效的解决方案,并得到理论保证和经验验证的支持。研究表明,BalLOT 可以产生积分耦合,并为恢复嵌入式聚类提供理论保证,而提出的初始化方案能够实现单步恢复。
-
新的T-ARC聚类方法利用拓扑纠正k-means的几何偏差
研究人员推出了一种新颖的拓扑感知随机聚类方法T-ARC,旨在克服传统k-means聚类固有的几何偏差。该新方法通过将数据的底层结构建模为潜在图,将拓扑信息直接整合到优化目标中。T-ARC结合了数据保真项和图割惩罚项,使用由持久同调(persistent homology)启发的随机块模型来捕获多尺度连通性。在合成和真实世界数据集(包括Fashion-MNIST)上的实验表明,T-ARC在恢复复杂拓扑结构方面表现优于k-means,并且…
-
稀疏自编码器赋能基础模型的视觉科学发现
研究人员开发了一种使用稀疏自编码器(SAEs)从基础模型中识别和排序视觉特征的方法,无需预先指定的概念即可实现科学发现。该方法在三个阶段进行了测试:一般概念再发现、领域特定概念再发现和驱动式特征排序。在ADE20K、FishVista和Heliconius butterflies等数据集上的评估中,与k-means聚类、PCA和SemiNMF等传统方法相比,SAEs在揭示模型表示中的语义结构方面表现更优。
-
新的模拟增强生成形式化方法提高了表示质量
研究人员为模拟增强生成(SAGE)引入了一种形式化方法。SAGE是一种在推理过程中模拟个体观点以提供更具代表性答案的技术。所提出的方法利用度量比例合理表示+(mPJR+),这是一个可以通过基于质心的聚类来满足的强比例公理。该方法表明,数量少得多的模拟可以有效地代表更大群体的观点,通过动态路由到这些模拟的子集,与基线方法相比,可以提高表示质量。
-
AI框架提升无人机网络安全性和能效
研究人员开发了一种新颖的框架,用于优化动态无人机(UAV)网络的部署,重点关注在易受威胁环境中的能效和运行安全。该方法采用威胁感知的K-means算法进行初始放置和聚类,然后进行最优匹配阶段以分配无人机并最小化能耗。多智能体孪生延迟深度确定性策略梯度(MATD3)算法随后动态调整轨迹、功率和用户关联。仿真结果表明,该框架实现了零安全违规,并在能效和收敛速度方面优于其他学习方法和非聚类基线。
-
新研究证明聚类算法固有的NP难性
一篇研究论文引入了通用聚类问题(UCP),以统一和解释各种聚类算法中固有的计算难度。该研究通过从图着色和精确三集覆盖中进行归约,证明了UCP是NP难的。通过将包括k-means、DBSCAN和谱聚类在内的十种常见聚类范式映射到UCP,该论文表明这些方法继承了这种根本性的棘手性,为观察到的故障模式提供了理论基础。
-
AI模型以98%的准确率对阿联酋建筑遗产进行分类
研究人员开发了一种新颖的多模态机器学习框架,用于对阿拉伯联合酋长国的建筑风格进行分类,特别是针对住宅建筑。该方法利用OpenAI的CLIP模型,将图像的视觉特征与专家的文本描述相结合,创建统一的嵌入。经过降维和聚类后,SVM分类器在区分八种不同的建筑风格方面达到了98%的准确率,优于现有方法,并展示了多模态AI在遗产分析方面的潜力。
-
新的CopDAG方法在无标签情况下增强了生物医学数据聚类
研究人员开发了一个名为类比有向无环图(CopDAG)的新框架,以改进生物医学数据的聚类。该方法将处理灵活多元分布的类比模型与使用有向无环图(DAG)进行因果结构发现相结合。CopDAG框架旨在通过捕获高维生物医学数据中的复杂依赖关系,且无需标签,来克服传统聚类方法的局限性。在对16个生物医学数据集的评估中,CopDAG在聚类准确性和调整兰德指数方面优于其他11种方法,证明了其直接从特征关系预测真实类别标签的能力。
-
LLM驱动的差分进化算法增强投资组合优化
研究人员开发了一种名为LLMDE的新算法,该算法将大型语言模型(LLM)集成到差分进化中用于投资组合优化。该方法旨在通过使用LLM根据优化反馈动态选择变异策略和配置参数,从而减少手动调整超参数的需求。LLMDE算法在CEC2022基准套件上进行了测试,并应用于解决条件在险价值(CVaR)投资组合优化问题,展示了具有竞争力的性能以及LLM辅助优化技术的潜力。
-
新方法可在定向随机块模型中实现精确社群恢复
研究人员开发了一种在新方法,可在稀疏定向随机块模型中实现精确社群恢复。该方法利用连接概率剖面的邻域平滑,根据估计的出连接概率剖面对顶点进行聚类。该方法建立了有限样本的统一行误差界限并证明了其一致性,在剖面分离超过估计误差时可实现精确恢复。该技术可适应消失的稀疏因子、非对称概率矩阵以及发散的社群数量,并通过数值研究和神经连接组应用说明了其行为。
-
无监督聚类方法有助于电力系统故障分析
研究人员开发了一种无监督聚类方法,利用电压和电流信号分析高压电力系统中的故障事件。该方法利用了 Réseau de Transport d'Électricité (RTE) 的数据,并通过快速傅里叶变换 (FFT) 提取频域特征。然后应用 K-Means 算法对故障进行分类,而无需标记数据,聚类结果由电力系统专家进行验证。
-
ZAPS 管道通过结合代理信号和拓扑结构来增强神经架构搜索
研究人员开发了 ZAPS,这是一个新颖的四阶段管道,旨在通过有效地将代理信号与架构拓扑相结合来改进神经架构搜索 (NAS)。该方法通过选择非冗余的代理子集并迭代地重新评估它们,解决了现有零成本代理的局限性,这些代理通常嘈杂且相关。ZAPS 利用混合 k-means 策略进行初始种子选择,并使用带有 UCB 获取函数的 XGBoost 集成来对候选者进行排名,在 CIFAR-10 和 CIFAR-100 的 NAS-Bench-201 …
-
NVIDIA cuML 和 RAPIDS 在 GPU 上加速机器学习工作流
本教程演示了如何使用 NVIDIA 的 cuML 和 RAPIDS 库通过 GPU 加速来实现机器学习工作流。它涵盖了设置 GPU 环境、使用 cuML 加速 scikit-learn 工作负载,以及利用原生 cuML API 与 CuPy 和 cuDF 直接互操作。该指南包括对 PCA、K-Means、逻辑回归和随机森林等各种算法的 CPU 和 GPU 性能进行基准测试,以及使用 UMAP、t-SNE 和 HDBSCAN 构建基于 …
-
Sector-Mean 初始化提供更快、更确定的 k-means 聚类
研究人员推出了一种新颖的确定性方法——Sector-Mean 初始化,用于 k-means 聚类的质心初始化。该方法将数据划分为围绕全局质心的角度扇区,并计算扇区均值,实现了 O(N) 的时间复杂度。在基准数据集和真实世界数据集上的评估表明,与 K-Means++ 相比,Sector-Mean 初始化将初始化时间最多缩短了 74.9%,同时保持了同等的聚类质量并减少了平均迭代次数。
-
新的CLUES-WEASEL算法提供更快、更准确的时间序列聚类
研究人员推出了一种新颖的时间序列聚类算法CLUES-WEASEL,旨在克服现有方法中常见的性能-运行时权衡问题。这种无监督方法使用WEASEL 2.0变换步骤的无监督版本提取特征,通过主成分分析降低维度,然后应用k-means聚类。实验表明,CLUES-WEASEL在聚类性能上优于当前算法,同时显著提高了运行速度。
-
新算法优化无人机部署以恢复灾难通信
研究人员开发了一种新算法——混合K均值量子启发式进化算法(HKQEA),以优化无人机(UAV)在灾后无线通信恢复中的部署。该算法旨在最小化部署的无人机数量,同时确保覆盖和分离约束得到满足。与NSGA-II和PSO等现有算法相比,HKQEA表现出更优越的性能,以8架无人机实现了满足覆盖、不重叠和最小距离要求的最佳解决方案。研究还强调了潜在的成本节约,从10架无人机减少到8架无人机可能带来硬件数量20%的下降。