k-nearest neighbors algorithm
PulseAugur coverage of k-nearest neighbors algorithm — every cluster mentioning k-nearest neighbors algorithm across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新的SAGE-XGBoost框架在数据稀疏条件下提升了灾害测绘能力
研究人员开发了SAGE-XGBoost,一个新颖的机器学习框架,旨在改善自然灾害易感性测绘,尤其是在数据稀疏的环境中。该框架将空间增强图嵌入与XGBoost相结合,通过结合数据增强和基于邻域的图嵌入来提高预测精度。SAGE-XGBoost在滑坡和野火易感性方面取得了约0.97和0.95的AUC值,表现优于现有模型,并在空间连贯性方面显示出显著改进。
-
新的CMR-Mamba方法改进了工业故障检测
研究人员开发了CMR-Mamba,一种用于工业系统无监督故障检测的新方法,它超越了传统关注单个传感器数据的技术。这项新技术利用Mamba状态空间编码器来监控传感器组之间的因果关系,识别可能逃避标准监控的耦合故障。在机电、液压和网络物理系统上的实验证明了CMR-Mamba的有效性,特别是在检测保持正常传感器统计数据的细微故障方面。
-
深度学习框架从史前手印中解码性别
研究人员开发了一个新颖的深度学习框架,旨在确定创作史前手印的个体的生理性别。这个不确定性感知的系统通过明确建模和传播不确定性来应对缺乏真实标签和人口差异等挑战。该方法包括图像处理、轮廓提取以及来自多个神经网络的集成预测,并通过流形映射和可解释人工智能技术进行验证。
-
新的自适应 KNN 分类器使用粒状球体计算提高效率
研究人员开发了一种新颖的自适应 k-近邻 (KNN) 分类器,该分类器使用粒状球体计算。该方法包括一个两阶段过程:首先,将数据集划分为粒状球体,并使用 Fisher 判据指导球体分裂以创建多粒度表示。其次,在预测过程中,识别最近的粒状球体,并在测试样本周围形成自适应邻域。有效的“k”值由该邻域内的样本数量动态确定,与现有的 KNN 变体相比,从而提高了准确性和效率。
-
CAKE框架协同设计编译器代理以促进GPU内核演进
研究人员开发了CAKE,一个新颖的协同设计框架,它整合了编译器技术和AI代理以增强GPU内核演进。该系统允许代理编写一种称为CAKE IR的专业中间表示(IR),该IR详细说明了硬件调度、内存移动和同步。该框架旨在提高专家GPU内核的可复现性和性能,超越将编译器视为黑箱的局限性。早期结果显示,在NVIDIA GPU上,Flash-KMeans和Kimi Delta Attention等应用程序的速度显著提升,并有可能实现更广泛的内核泛化。
-
新研究将动力学模型应用于真实世界强化学习的离线超参数选择
一篇新研究论文探讨了在真实世界强化学习(RL)应用中使用动力学模型进行离线超参数选择。该研究展示了这些模型在工业环境中的首次应用,具体是在一个市政水处理厂,使用了高维、非平稳的传感器数据。研究结果表明,校准模型可以生成逼真的长时序回滚,并识别有意义的超参数敏感性趋势,为RL在实际环境中的部署提供了概念验证,同时也指出了挑战。
-
机器学习模型在LPWAN路径损耗预测方面表现出改进
研究人员对低功耗广域网(LPWAN)中预测路径损耗的机器学习模型进行了系统性分析,特别关注LoRa技术。该研究采用了利用LiDAR衍生的地形特征的随机森林模型和使用坐标数据的k近邻模型,并将它们的性能与传统的经验模型进行了比较。结果表明,机器学习方法在预测性能上持续优于基线模型,实现了更低的均方根误差(RMSE),尤其是在部署内的插值方面。
-
新的机器学习框架利用RIS和毫米波感知增强6G定位
研究人员开发了一个新的机器学习框架,用于在利用可重构智能表面(RIS)和毫米波(mmWave)感知的6G网络中进行精确本地化。该方法将接收到的信噪比(SNR)映射到用户设备(UE)的方位角和距离,即使在直接链路不可用时也是如此。该框架已扩展到处理跨链路干扰,这种干扰比距离估计更严重地降低了角度估计。
-
机器学习模型检测社交媒体上的用户死亡
一篇新的论文详细介绍了能够自动检测社交网站上已故用户的机器学习分类器的开发。该研究利用了从Wikidata和X(前身为Twitter)汇编的新数据集,训练了包括SVM和RF等传统算法以及BiLSTM、CNN和BERT等深度学习模型的各种模型。研究发现,BERT取得了最高的性能,优于所有其他模型。对语言特征的分析显示,死后推文表现出更高的负面情绪,并且更频繁地使用与消极、家庭、宗教和死亡相关的词语,而生前推文则表现出更高的中性情绪,并且…
-
新的“Local Shapley”方法大幅削减数据评估计算量
研究人员推出了一种名为“Local Shapley”的新型数据评估方法,该方法显著降低了计算复杂度。与考虑所有可能的训练数据组合的传统方法不同,Local Shapley 利用了现代预测模型固有的局部性,仅关注直接影响预测的数据子集。这种方法将评估问题重新构建为结构化数据处理任务,从而为重新训练操作设定了理论下限,并实现了 LSMR 和 LSMR-A 等高效算法。跨不同模型系列的实验结果表明,在保持数据评估高精度的同时,重新训练时间和…
-
新的尺度律指导 AI 嵌入中分布偏移的检测
研究人员开发了一种新的尺度律,用于检测高维嵌入中的分布偏移,该尺度律约束了基于矩的统计检验。该尺度律源自切比雪夫极值问题,表明所需的多项式检验程度取决于特征的尺度和质量分数。提出了一种实用的校准规则,表明 MMD 检验的最佳带宽应与特征尺度相匹配。在真实嵌入流上的实验表明,这种数据驱动的带宽方法实现了高 AUC 分数,并且能有效对抗针对其他统计数据优化的对手。
-
新的POSSE-kNN方法提高了二分类准确性
一种新的机器学习方法POSSE-kNN已被开发用于二分类任务,特别是针对表格数据。这种集成技术结合了自助采样、随机特征子空间、袋外筛选和新颖的路径邻居选择。在十个基准数据集上的评估表明,与六种已建立的方法相比,POSSE-kNN在准确性、Cohen's kappa和Brier分数方面取得了更优的总体结果。
-
开源工具以更低成本和更高效率优化 AI 模型
Experiential Labs 发布了一款名为 World Model Optimizer (wmo) 的开源工具,旨在降低部署 AI 模型的成本。该工具优化代理轨迹以创建更小、更高效的模型,并可以在前沿模型和更小的模型之间路由请求,以在较低成本下保持质量。它支持各种优化策略,包括模型蒸馏、部署单个模型以及为代理构建优化的工具链,并提供本地或云托管执行选项。
-
集成分类器提升线路故障定位性能
研究人员探索了使用集成分类器来提高电力系统线路故障定位的性能。他们的研究比较了各种集成方法与单一模型方法,利用了通过贪婪最大覆盖问题(MCP)、高eta和随机选择算法选择的观测输电线路(OTLs)的数据。研究结果表明,由贪婪MCP算法识别的OTLs与集成分类器相结合,其性能显著优于基础kNN分类器,其中extra-trees bagging技术在许多情况下取得了最高的F1分数。
-
新的AI框架利用SAR图像和GT估算识别暗船
研究人员开发了一个新颖的框架,用于识别那些禁用应答器以逃避监视的“暗船”。该系统结合了一个多任务深度学习模型来预测船舶位置、类型和尺寸,以及一个用于总吨位估算的k近邻算法。该方法利用异构图像和表格数据集,解决了端到端训练中缺乏公共SAR数据集的问题。发布的代码旨在通过识别应配备应答器但未配备的船舶来提高海事安全。
-
单通道sEMG在高效手势识别方面展现潜力
研究人员探索了使用单通道表面肌电图(sEMG)进行手势分类,旨在实现更高效、低功耗的系统。通过提取各种时域和频域特征,并应用LDA和PCA等降维技术,他们使用紧凑型神经网络实现了高达90%的准确率。这种方法展示了在嵌入式应用中实现经济高效的手势识别的潜力。
-
新的ASK-NN测试通过分布漂移检测LLM幻觉
研究人员开发了ASK-NN,一种新颖的不对称最近邻测试,旨在检测自然语言中的分布漂移,这是LLM输出中幻觉或人工文本的常见指标。该方法由于其固有的长度不对称性而区别对待提示和响应样本。ASK-NN计算效率高,在识别人工文本和LLM幻觉方面,其性能优于现有基准。
-
TabPFN在多模态分类任务中展现潜力
一篇新的研究论文探讨了TabPFN作为多模态任务分类头的有效性,将其应用范围从传统的表格数据扩展开来。研究发现,与k近邻和逻辑回归等常见的轻量级分类头相比,TabPFN在图像、文本和音频编码器上显著提高了校准和准确性。尽管TabPFN表现强劲,但其优势在特定场景下最为突出,例如中高shot计数和较低的特征维度。
-
LLM候选生成助力Vrbo长尾房源
研究人员开发了一种新颖的、无需训练的基于LLM的候选生成系统,旨在改进Vrbo等度假租赁平台上的房产推荐。该系统解决了传统协同过滤方法因交互数据不足而难以有效服务的“长尾”房源列表的挑战。通过利用静态房源元数据和现成的LLM来合成语义查询,该系统生成多样化的候选并将其与现有方法融合,在不降低热门房源服务性能的情况下显著扩展了不太受欢迎房源的覆盖范围。该方法还表明,对于大规模目录应用,小型、自托管的LLM可以实现与前沿API模型相媲美的性能。
-
新指标评估语言模型路由策略的有效性
研究人员开发了一个新的框架来评估语言模型路由策略,重点关注行为差异化和稳定性,而不仅仅是任务准确性。他们提出采用分层社会熵(HSE)来衡量代理多样性,并使用基于扰动的指标来衡量鲁棒性。将这些方法应用于 EmbedLLM 和 RouterBench,他们发现一小部分代理就可以捕捉到大部分可用多样性,并且虽然 KNN 路由器可以提高专家社会的准确性,但它们缺乏鲁棒性,这一点与提示路由不同。