random forest
PulseAugur coverage of random forest — every cluster mentioning random forest across labs, papers, and developer communities, ranked by signal.
- instance of DagsHub 90%
- competes with TabPFN 80%
- instance of logistic regression model 70%
- used by Gotit.pub 70%
- competes with multilayer perceptron 70%
- instance of decision tree 70%
- used by alphaXiv 70%
- instance of multilayer perceptron 70%
- competes with decision tree 70%
- competes with LightGBM 70%
- competes with gradient boosting 70%
- competes with naive Bayes classifier 70%
- 2026-05-19 research_milestone A new paper proposes a kernel-based smoothing mechanism to improve random forest regression. 来源
17 天有情绪数据
-
新方法量化树模型中Shapley值的鲁棒性
研究人员开发了一种使用不精确狄利克雷模型(IDM)的新方法,用于分析决策树和随机森林中Shapley值的鲁棒性。该方法在将未标记实例引入树叶时,量化和检查区间值Shapley值。该方法允许基于悲观和平均原则计算这些区间值Shapley值,并且可以扩展到Banzhaf值。实验证明了这些区间值Shapley值的行为及其在消除无信息特征偏差方面的效用。
-
新的 Weisfeiler-Leman 特征增强了约束编程中的算法选择
研究人员开发了一种新的约束编程算法选择方法,该方法利用 Weisfeiler-Leman (WL) 特征。这种方法实现了特征提取的自动化,超越了传统的手动统计方法,能够捕捉底层问题结构。提出的基于割的表示(称为 WLc)对结构分区进行建模,以提供更细致的预测信号。在 MiniZinc Challenge 实例上使用支持向量机、随机森林和多层感知器进行的实验表明,WLc 特征的性能优于现有方法。
-
LLM 级联因模型错误相似而失败,违反集成理论
LLM 级联使用更便宜的模型进行初步响应,并在需要时升级到更强大的模型,但由于模型基于相似数据训练,因此会产生相似的错误,导致它们常常无法实现成本节约。这违反了集成理论的原则,该理论要求组件模型具有去相关的故障。为了改进级联,重点应放在创建模型故障的结构多样性上,而不仅仅是改变其成本或大小。
-
研究发现:视网膜血管分割准确性受阈值选择影响
一篇新的研究论文评估了观察者选择和阈值选择对视网膜血管分割准确性的影响。该研究使用了CHASE DB1数据集,并分析了不同的阈值策略,包括固定阈值、观察者调优和最大最小值调优。结果表明,尽管最大最小值调优在大多数拟合中改变了阈值,但它在最差观察者Dice得分方面几乎没有提高。该论文提倡明确报告阈值选择和评估参考,以确保分割准确性评估的清晰度。
-
EMD-LSTM-Markov模型在建筑热负荷预测精度方面领先
一篇新论文综述了用于建筑热负荷短期预测的混合预测模型,比较了各种数据驱动技术。研究发现,经验模态分解-长短期记忆-马尔可夫(EMD-LSTM-Markov)模型在预测提前一天供暖和生活热水需求方面取得了最高的准确性。虽然该模型准确预测了局部电力峰值,但它低估了高功率浪涌和尖峰。其他评估的方法,如SVM-SA和RF-ISSA-LSTM,产生了更平滑的需求曲线,但峰值预测精度较低。
-
新的中性集成方法提高了轴承故障检测的不确定性感知能力
研究人员开发了一种新颖的中性集成分类方法,以提高轴承故障检测中的不确定性感知能力。该方法将随机森林、XGBoost 和逻辑回归集成分解为四个指标:最高类证据、最佳竞争者证据、预测熵和决策分歧。在实验室和工业基准上的实验表明,预测熵与误差具有良好的相关性,比传统的置信度分数提供了更好的见解。研究还发现,融合时域和频域模型并对其 Jensen-Shannon 散度进行评分,尤其是在分布变化下,其性能优于单个模型。
-
作物产量预测研究揭示关键数据验证缺陷
一项关于巴基斯坦旁遮普作物产量预测的研究论文,指出了数据验证和模型性能方面存在的重大问题。该研究开发了一个结合了树集成模型和叶片健康分类器的原型,该原型最初在一个源自 Kaggle 的数据集上显示出较高的 R2 分数。然而,经过仔细检查,发现该数据集仅包含 46 个独立观测值,导致准确性虚高。在使用更稳健的验证方法和更大的 FAOSTAT 数据集时,简单的线性趋势优于复杂模型,而叶片健康分类器尽管在单独的图像数据上具有高准确率,但无法…
-
新的交叉拟合方法改进了机器学习模型的统计推断
一种名为交叉拟合的新统计方法已被开发出来,以解决模型推断中的非正则性问题。该方法仍然遵循中心极限定理,但需要调整其渐近方差以考虑交叉折叠相关性。所提出的置信区间旨在估计这种相关性,目标是实现渐近名义覆盖率,并在随机森林和神经网络的模拟中显示出有希望的结果。
-
新流水线自动化脑成像中的 3D 树突分割
研究人员开发了一种用于 SBF-SEM 图像中 3D 树突分割的自动化流水线,这是理解大脑可塑性的关键步骤。该系统集成了 YOLOv6 和 Segment Anything Model (SAM) 进行初始分割,然后使用随机森林进行掩码精炼和 3D 实例链接。该流水线通过 nnU-Net 完成高分辨率精炼,实现了高语义准确性和有效的实例分离,尽管在癫痫组织等密集区域仍存在挑战。
-
AI数据管道改进了美国建筑计量预测
一篇新的研究论文详细介绍了一个数据引导管道,该管道旨在检测和修复美国建筑计量数据中的缺陷,然后再将其用于训练AI需求预测模型。该管道旨在通过解决诸如读数缺失或传感器冻结等问题来提高预测准确性。在Building Data Genome 2数据集上进行的受控实验表明,即使在现场研究中观察到的缺陷普遍存在的情况下,该管道也能有效地将预测准确性恢复到基线水平,同时保留了大部分训练目标。
-
新的幻象状态攻击利用 IIoT 入侵检测中的时间同步
研究人员引入了一种名为幻象状态攻击(PSA)的新型攻击,该攻击针对工业物联网(IIoT)环境中的入侵检测系统(IDS)。与以往修改数据或查询模型的对抗性方法不同,PSA 利用 IDS 中数据聚合窗口的时间同步性。通过引入细微的时间漂移,该攻击会导致 IDS 重构一个错误的运行状态,从而降低检测能力。该方法在 ToN-IoT 和 CIC IIoT 2025 数据集上针对随机森林、MLP 和 XGBoost 等常见机器学习模型进行了评估,…
-
Jev 模型在网络流量分类方面展现出潜力,但落后于传统方法
一篇新论文评估了通用决策模型 Jev 在网络流量分类方面的表现,并将其与 Random Forest、Extra Trees 等传统方法以及 OpenAI GPT-5.6 Sol 语言模型进行了比较。研究发现,虽然 Jev 的准确性随着标记示例的增加而显著提高,但仍落后于训练过的树集成模型。与 GPT-5.6 Sol 相比,Jev 的处理时间和成本较低,尽管在测试配置下,两种模型在准确性方面均未显示出明显优势。
-
Google的Yggdrasil决策树通过新的直方图技术得到提升
研究人员开发了矢量化动态直方图,以显著加快稀疏斜(SPO)决策树的训练速度。这些新方法已集成到Google的Yggdrasil Decision Forests库中,将SPO-RF的训练效率提高了2倍,SPO-GBT提高了1.6倍,使得SPO-RF的训练时间与轴对齐随机森林相当。该优化在海量数据集上进行了评估,并且该实现已开源。
-
新的混合方法提高了表格数据插补的速度和准确性
研究人员开发了两种新颖的表格数据插补混合方法,分别命名为NuclearForest和SoftForest。这些方法将奇异值阈值处理(SVT)和SoftImpute等低秩初始化技术与非迭代的随机森林精炼相结合。该方法旨在提高插补精度,并与现有的迭代方法相比,显著降低计算成本。广泛的基准测试表明,NuclearForest和SoftForest在速度上分别比MissForest等最先进的方法快约5.81倍和9.52倍,并且取得了相当或更优的结果。
-
AI框架增强了对罕见皮肤淋巴瘤的检测
研究人员开发了一种双尺度机器学习框架,以改进蕈样肉芽肿(MF)的检测,这是一种罕见的皮肤T细胞淋巴瘤。该系统结合了对两种放大倍率(10倍和20倍)下的组织病理学图像的深度学习分析,以及使用临床特征的随机森林分类器。这种多模态方法旨在帮助皮肤科医生区分MF与其他皮肤病,并在确诊病例的分期中提供帮助,在实验试验中显示出显著的准确性。
-
类型学特征可预测零计算下的跨语言迁移性
研究人员开发了一种使用类型学特征来估计跨语言迁移性的方法,这些特征易于获取且成本低廉。该方法利用随机森林模型,能够以很高的准确性预测迁移性,优于不考虑类型学数据的模型。研究结果表明,类型学数据库为筛选潜在源语言提供了一种有价值的、低计算成本的替代方案,无需进行广泛的多语言预训练。
-
新的混合方法提高了表格数据插补的速度和准确性
研究人员开发了两种新颖的混合方法,NuclearForest 和 SoftForest,用于插补表格数据集中缺失的数据。这些方法将基于核范数的低秩初始化技术(SVT 和 SoftImpute)与随机森林精炼步骤相结合。这种方法旨在比现有的迭代方法更有效地捕捉全局协方差模式和局部非线性信号。广泛的基准测试表明,NuclearForest 和 SoftForest 在插补准确性方面与 MissForest 等最先进的方法相当或更优,同时提…
-
新的 arXiv 论文利用大语言模型和基准测试解决网络入侵检测问题
两篇最新的 arXiv 论文利用机器学习解决了网络入侵检测系统(NIDS)的问题。第一篇论文介绍了 JEV-IDS,一个实验性的 NIDS,它利用一个 Jev System One Model (SOM) 来检测标签稀缺情况下的零日入侵,与 GPT-5.6 Luna 和 Random Forest 相比,在速度、成本和新型攻击召回率方面均有所提高。第二篇论文提出了一个全面且可复现的多类别、多层级网络入侵检测基准测试,指出了现有研究中的…
-
Jev AI:在大型语言模型进展中出现的新型文本分类器
文章探讨了文本分类模型的历史和能力,重点关注 Jev AI 的近期出现。在承认先进的大型语言模型可以执行类似任务的同时,作者强调了 Jev AI 在分类速度和成本效益方面的优势。该文将 Jev AI 与词袋模型等传统方法以及基于 Transformer 的现代模型进行了对比,认为 Jev AI 为特定的分类需求提供了通用性和性能的独特平衡。
-
新的SAGE基准评估AI模型在物种分布准确性方面的表现
研究人员推出SAGE,一个旨在通过考虑采样偏差和物种流行度来评估物种分布模型(SDMs)的新基准。该基准利用来自GBIF和sPlotOpen的数据,结合社区科学记录和植被样地数据,评估了5771种植物的建模性能。初步研究结果表明,虽然随机森林和基于深度学习的SDMs(DeepSDMs)总体表现良好,但DeepSDMs主要在记录频率较低的物种方面显示出优势,尤其是在应用偏差校正技术时。