k-means clustering
PulseAugur coverage of k-means clustering — every cluster mentioning k-means clustering across labs, papers, and developer communities, ranked by signal.
- used by alphaXiv 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- instance of CatalyzeX 70%
- competes with Gaussian Mixture Models 70%
- competes with Birch 70%
- competes with hierarchical clustering 70%
- used by CatalyzeX 60%
- instance of Gaussian Mixture Models 50%
- other hierarchical clustering 50%
13 天有情绪数据
-
新的ICOMT框架通过最优多路决策树增强聚类可解释性
研究人员开发了一个名为“通过最优多路决策树实现可解释聚类”(ICOMT)的新计算框架,以增强聚类结果的可解释性。该方法利用一种新颖的基于一维k-means聚类的数值特征离散化技术,并构建了一个二元线性优化问题来确保树的最优性。在公共数据集上的实验表明,ICOMT在聚类准确性方面优于现有方法,同时生成更简洁、更具可解释性的决策树。
-
人工智能利用牛奶光谱识别奶牛健康群体
研究人员开发了一种利用牛奶中红外光谱的元聚类方法,以识别早期泌乳期经历负能量平衡的奶牛的不同群体。通过结合光谱滤波、主成分分析(PCA)和自动编码器等降维技术,以及k-means和谱聚类等聚类算法,他们识别出了五个元聚类。这些聚类与泌乳天数高度相关,并显示出不同程度的负能量平衡,其中一些群体表现出快速或早期恢复。值得注意的是,一种计算效率高、基于PCA的k-means方法有效地复制了更复杂方法的研究结果。
-
AI 框架使用拉曼光谱准确识别食用油
研究人员开发了一种使用拉曼光谱和机器学习来鉴定食用油的新方法,即使在炸薯片等复杂食品基质中也能实现。该研究利用物理信息人工智能 (PI-AI) 将光谱数据与可解释的分类模型联系起来。通过采用决策树和 K-means 聚类等技术,该框架可以使用显著减少的光谱变量集实现高分类准确率,展示了高效便携食品质量监测的潜力。
-
无监督网络流量分类使用 HDBSCAN 和 K-Means
本文详细介绍了一种无监督网络流量分类方法,用于区分在单个自治系统编号 (ASN) 下运行的不同消费品牌。该方法利用了网络层信号,如 DNS 解析器 IP、IP 范围和会话计数,这些信号通常被标准的 IP-to-ISP 数据库所忽略。通过采用特征工程技术,如通配符 IP 清理、前缀提取以及对偏斜数值数据的日志转换,作者为 HDBSCAN 和 K-Means 等聚类算法准备数据,以便在没有预先存在训练数据的情况下分配品牌标签。
-
新框架利用人工智能和仿真优化城市空中交通网络
一项新的研究论文提出了一个框架,通过整合垂直起降场选址与机队仿真来设计按需城市空中交通(UAM)网络。该系统估算需求,将其聚类以识别潜在的垂直起降场位置,然后使用离散事件仿真来模拟车辆调度、重新部署和电池更换。在洛杉矶大都会区进行的一项案例研究表明,虽然更大的机队可以提高服务的规律性,但并不能消除空载飞行,这凸显了空间需求不平衡的持续挑战。
-
新的SRF-ICA方法改进了独立成分分析的联邦学习
研究人员开发了一种名为谱鲁棒联邦ICA(SRF-ICA)的新方法,以提高联邦独立成分分析(ICA)的准确性。该方法解决了局部ICA估计器质量不一且仅可识别符号排列的问题。SRF-ICA构建了一个符号不变的亲和矩阵,使用谱k-means进行排列解析,对齐符号,然后采用几何中位数进行鲁棒聚合。该方法被证明即使在大量低质量局部估计器的情况下也能保持准确性,前提是每个簇中大多数原子是可靠的。
-
新的 EMS Coreset 算法为机器学习提供高效数据子集选择
研究人员开发了 EMS Coreset,这是一种旨在更高效地为机器学习任务创建代表性数据集子集的新算法。该方法利用带有 Sinkhorn 正则化的期望最大化方法,允许非均匀的 coreset 权重,并提供广义的 k-means 聚类解决方案。与现有的 Wasserstein 和标准 Sinkhorn coreset 选择技术相比,该算法在近似质量和鲁棒性方面表现出竞争力,同时显著减少了计算时间,尤其是在处理大型数据集时。
-
机器学习优化6G波束赋形,侧重网络特征
本研究论文探讨了机器学习技术在6G网络波束赋形优化中的应用。研究比较了监督和无监督机器学习方法,分析了网络、环境、设备和视觉数据等各种特征组。结果表明,网络特征对波束赋形优化更具预测性,而聚类分析显示部署环境和设备类型是场景分组的关键因素。论文还强调了带宽、物联网传感器和移动性对特征重要性的影响,并建议未来的工作涉及深度学习和强化学习。
-
CAKE框架协同设计编译器代理以促进GPU内核演进
研究人员开发了CAKE,一个新颖的协同设计框架,它整合了编译器技术和AI代理以增强GPU内核演进。该系统允许代理编写一种称为CAKE IR的专业中间表示(IR),该IR详细说明了硬件调度、内存移动和同步。该框架旨在提高专家GPU内核的可复现性和性能,超越将编译器视为黑箱的局限性。早期结果显示,在NVIDIA GPU上,Flash-KMeans和Kimi Delta Attention等应用程序的速度显著提升,并有可能实现更广泛的内核泛化。
-
新研究探讨k-means聚类的不相容性与平衡性
Adam Quinn Jaffe和Pollard的一篇新arXiv论文研究了k-means聚类的细微差别,特别是在总体分布具有有限期望而非有限方差的情况下。研究强调,即使总体层面的中心存在,经验k-means聚类中心也可能不收敛,这是由极端聚类不平衡和离群样本引起的微妙之处。该论文还提出通过确保经验聚类之间一定程度的平衡来恢复渐近相容性的方法。
-
新的 Gromov-Wasserstein 量化方法扩展了 k-means 聚类
一篇新论文将 Gromov-Wasserstein (GW) 量化作为传统 k-means 聚类的扩展。该方法不仅对数据点进行聚类,还考虑了空间的嵌入几何,提供了新的建模可能性。该研究为 GW 量化提供了理论保证,并提出了一种类似于 Lloyd 算法的数值近似算法,证明了其在分析 3D 形状和修剪神经网络等应用中的效用。
-
Gromov-Wasserstein 量化扩展 K-Means 以实现几何感知聚类
本文将 Gromov-Wasserstein (GW) 量化作为传统 k-means 聚类的扩展。与在空间内进行点聚类的标准 Wasserstein 量化不同,GW 量化还考虑了空间本身的几何结构。该研究证明了 GW 量化的解的存在性,并提出了一种类似于 Lloyd 算法的数值逼近算法。研究还分析了欧几里得几何的量化速率,并通过实验证明 GW 量化提供了新的建模能力,例如用于 3D 形状和神经网络剪枝。
-
新算法通过优化空间离散化来改进野火预测
研究人员开发了一种新颖的野火预测方法,该方法超越了传统的基于网格的系统。通过采用一种结合了分水岭检测和k-means聚类的无监督算法,该系统根据历史火灾模式定义预测单元。这种数据驱动的方法在法国的各种模型和地理区域的野火预报准确性方面取得了持续的改进,优于基于网格的方法。
-
Transformer 架构精确实现 k-means 聚类算法
一篇新的研究论文详细介绍了一种“k-means transformer”架构的创建,该架构可以精确执行 k-means 聚类的 Lloyd 算法。该研究从理论上证明并通过实证表明,像注意力块和残差连接这样的标准 transformer 机制可以实例化这种精确的算法例程。此外,研究表明该架构可以学习和泛化聚类任务,在某些情况下甚至优于传统的 Lloyd 算法,并且可以修改以实现软 k-means 和球形 k-means 等变体。
-
新框架实现无源高光谱图像分类
研究人员开发了一种新的拓扑感知学习框架,以解决在源域数据不可用的情况下进行跨场景高光谱图像分类的挑战。该方法利用熵动量伪标签来优化分配,并采用上下文邻域拓扑来捕捉目标特征空间的几何结构。在三种场景下的实验表明,这种无源方法优于现有的最先进方法,突显了拓扑感知建模在无源数据准确分类中的重要性。
-
Hacker News 用户分享视觉 AI 和技术学习资源
一位 Hacker News 用户整理了一份高度视觉化和动画化的资源列表,用于学习各种技术主题,包括 Transformer 和视觉 LLM 等 AI 概念。该用户创建此列表是为了应对平台上似乎过多的 AI 相关观点帖子。精选的资源涵盖了从机器学习算法和神经网络到计算机硬件和软件开发等广泛的主题,重点是交互式和动画解释。
-
新框架改进了用于深度学习的医学影像数据集划分
研究人员开发了一种新的纵向医学影像数据集划分框架,以提高深度学习模型的可靠性。该三方数据集分析框架系统地分析了空间完整性、强度指纹和时间轨迹,以量化特征分散和采样不平衡。所提出的无监督协议结合了K-means聚类和分层采样来平衡队列,与随机划分方法相比,显著减少了强度偏差并对齐了纵向随访间隔。
-
改进型k-means聚类方法提高了高斯数据的准确性
研究人员开发了一种新的k-means聚类算法,通过同时纳入簇内距离(WCD)和簇间距离(ICD)指标来提高准确性。这种新方法旨在提供更稳健的聚类分析,尤其适用于高斯数据。在UCI存储库的合成数据集和基准数据集上进行的实验表明,该算法提高了数据向簇的收敛性,并且与传统的k-means方法相比,在正确识别和放置异常值方面更有效。
-
TabPFN 上下文采样提高了在小型数据集上的准确性和稳定性
一篇新的研究论文探讨了上下文采样在 TabPFN 中的有效性,TabPFN 是一个使用上下文学习对表格数据集进行分类的模型。该研究在 15 个 OpenML 数据集上进行,发现更大的上下文大小能显著提高预测稳定性和准确性。研究人员还发现,多样性和特征空间覆盖比匹配训练数据的特征均值对准确性更关键。论文得出结论,随机采样之所以有效,是因为其固有的特征空间覆盖能力,而不是复制数据分布的能力。
-
新研究评估无监督亚组方法在卫生政策优先排序中的应用
一篇新研究论文评估了分析观察性健康数据的几种无监督亚组方法,旨在识别可解释的亚组以用于政策优先排序。该研究使用 Pima Indians Diabetes 数据集和 NHANES 等数据集比较了 K-means、模糊聚类和贝叶斯高斯混合模型。虽然一些方法对假设性状态转移显示出有希望的效用估计,但置信区间表明调整后没有统计学上的显著差异,这表明研究结果是依赖于假设的决策支持,而不是干预效益的证明。