Smote
PulseAugur coverage of Smote — every cluster mentioning Smote across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
IJCAI-ECAI 2026 开幕,表彰人工智能先驱和新研究 · 追踪 1 个来源
第35届国际人工智能联合会议(IJCAI-ECAI 2026)在德国不来梅开幕,庆祝该领域的重要成就。斯坦福大学的吴佳俊因其在计算机视觉、生成式AI和机器人领域的开创性工作,荣获享有盛誉的“计算机与思想奖”。会议还设立了新的“经久不衰奖”,表彰SMOTE算法在机器学习领域,特别是在解决数据不平衡问题上产生的持久影响。
-
研究揭示了对AI不平衡处理的单一数据集评估不可靠
一项发表在arXiv上的新研究调查了在单一数据集上评估类别不平衡处理方法的普遍做法,证明了从这种有限测试中得出的结论可能具有误导性。该研究分析了45个二分类任务,发现像阈值调整和SMOTE等技术,在像Kaggle的信用卡欺诈数据集这样的特定数据集上可能几乎没有益处甚至有害,但在更广泛的不平衡比率范围内可能非常有效。研究还显示,阈值调整的益处随不平衡比率呈非单调变化,并且标准的校准诊断不能可靠地预测调整的有效性,这表明需要更稳健的评估协议。
-
两篇新论文提出鲁棒的 RVFL 网络变体以应对噪声数据
两篇新的研究论文介绍了增强随机向量函数链接(RVFL)网络鲁棒性的新方法。RVFL 网络以其效率而闻名,但容易受到噪声数据的影响。第一篇论文 RoBell-RVFL 提出了一种质量感知、样本级别的加权机制,该机制在自适应地降低受噪声或异常值影响的多数类样本权重时,保留了少数类信息。第二篇论文 KRPRVFL 集成了一个核风险敏感的 p 次幂均值标准和一个协作学习机制,以减轻损坏样本的影响并提高稳定性。两种方法都在基准数据集上进行了评估…
-
新的几何过滤方法增强了用于文本分类的LLM生成数据
研究人员开发了一种新颖的几何过滤框架,以提高大型语言模型(LLM)为文本分类任务生成的合成数据的质量。该方法根据LLM生成的样本在嵌入空间中到真实数据点的欧氏距离进行评估,仅选择在几何上与目标类别一致的样本。该方法在各种数据集和分类器上均显示出显著的改进,优于SMOTE等现有方法,并在命名实体识别任务中表现出特别的功效。
-
新的CISO框架为不平衡学习提供每实例安全保证
研究人员开发了认证插值安全过采样(CISO),一个新颖的三阶段框架,旨在为不平衡学习任务生成合成数据实例。与仅关注预测性能的传统方法不同,CISO包含一个安全目标,确保每个合成实例都具有可验证的安全属性。该框架在合成数据与多数类之间的距离方面提供了保证,并允许在边界搜索和内部搜索合成之间进行受控的转移,同时保持具有竞争力的预测准确性。
-
B2B电子商务交易预测框架通过DiCE和PyPARC提高精度
一篇新论文介绍了一个用于预测B2B电子商务中交易倾向的框架,解决了传统方法(如SMOTE)难以应对的异构买家行为带来的挑战。所提出的方法利用多样化反事实解释(DiCE)生成合成数据,提高了比SMOTE更好的分布保真度。此外,它还采用了PyPARC框架进行校准的倾向概率,从而能够将客户细分为风险等级。该架构在一个大型B2B电子商务平台上进行评估,在0.8的决策阈值下达到了93.1%的精度,显著优于基于SMOTE的基线。
-
新的多生成器GAN改进了预测性维护中的罕见故障检测
研究人员开发了一种专用的多生成器生成对抗网络(GAN),以改进预测性维护系统中罕见故障的检测。这种新方法解决了传统方法在故障数据中假设同质性的局限性,而在工业环境中这通常并非如此。在AI4I 2020预测性维护数据集上的实验表明,与现有技术相比,多生成器GAN框架生成的少数类样本更逼真,在PR-AUC和召回率方面表现更好。
-
新的RoBERTa框架解决了网络安全漏洞分类中的类别不平衡问题
一篇新的研究论文提出了一种层次感知RoBERTa框架,用于解决使用通用弱点枚举(CWE)分类法进行网络安全漏洞分类中的类别不平衡问题。该框架通过可学习的父类嵌入显式地整合CWE结构信息,以保持分类法的一致性。在CWE研究概念数据集上的实验表明,该方法实现了0.76的加权F1分数,优于SMOTE和ADASYN等传统过采样技术,并显著提高了少数类别的性能。
-
量子电路出生机增强了不平衡数据集的合成数据生成
研究人员开发了一个混合量子经典框架,利用量子电路出生机(QCBMs)为不平衡表格数据集生成合成数据。该方法利用叠加和纠缠等量子特性,比传统方法更有效地模拟复杂概率分布。在 Iris 和 Telco Customer Churn 数据集上的实验表明,使用 QCBM 生成的样本增强数据可将 F1 分数提高 5-15%,少数类召回率提高 10-25%,证明了强大的分布保真度和与 SMOTE 等经典过采样技术相比具有竞争力。
-
新的CPAC方法通过改进的潜在空间聚类来增强欺诈检测
研究人员开发了一种名为因果原型注意力分类器(CPAC)的新方法,以改进欺诈性信用卡交易的检测。该方法通过增强分类器区分合法和欺诈活动的能力,解决了金融数据中极端类别不平衡的挑战。CPAC利用基于原型的注意力机制,并与变分自编码器-生成对抗网络(VAE-GAN)集成,以在潜在空间中实现更好的分离,其性能优于SMOTE等传统过采样技术和其他生成模型。所提出的方法在评估中取得了93.74%的显著F1分数和92.85%的召回率。
-
重采样方法会降低模型校准能力,但重新校准可提供解决方案
一篇新发表在arXiv上的研究论文探讨了重采样方法对树集成模型概率校准能力的影响。研究发现,虽然SMOTE(合成少数类过采样技术)会导致校准能力轻微下降,但随机欠采样会带来重大风险,尤其是在高不平衡比率下,它会扭曲训练数据,使概率估计不可靠。幸运的是,像Platt或等渗缩放这样的事后重新校准技术可以有效消除这种校准损害,同时对判别性能的影响极小。
-
混合CNN-LSTM模型提升可再生能源电网网络安全
研究人员开发了一种新颖的混合CNN-LSTM框架,旨在增强智能可再生能源电网的网络安全。该模型通过结合CNN的空间特征提取和LSTM的时间序列建模,能有效检测即时异常和渐进式、低速攻击活动。该框架在NSL-KDD等基准数据集上展示了高精度和高召回率,精度高达98.2%,并且其效率通过GPU上每秒27,800个流的实时推理吞吐量得到证实,表明其在资源受限设备上部署的可行性。
-
新AI模型利用脑电图数据增强轻度认知障碍检测能力
研究人员开发了一种新的可解释概念引导多项式表格Kolmogorov-Arnold网络(CPTabKAN),用于利用脑电图(EEG)数据检测轻度认知障碍(MCI)。这种新颖的方法将EEG衍生的特征映射到概念表示,并进行扩展以揭示交互作用,然后使用TabKAN分类器进行非线性边界学习。在骨质疏松性骨折研究队列上进行的评估显示,CPTabKAN的加权F1分数达到了0.9038,优于GradientBoosting,并证明了概念结构化、交互感…
-
AI框架增强网联汽车的预测性维护
一篇新的研究论文详细介绍了一个用于网联汽车预测性维护的框架,该框架将内部诊断信号与外部环境数据(如道路质量和天气)相结合。该方法通过在印度、德国和巴西进行的模拟和真实现场测试得到验证,在检测车辆磨损事件的准确性方面取得了显著提高。研究还证实了基于边缘的推理在降低延迟方面的有效性,并强调了上下文特征在预测模型中的重要性。
-
新的QC-SMOTE方法提高了不平衡分类的准确性
研究人员开发了QC-SMOTE,一种新颖的过采样框架,旨在提高不平衡数据集上的分类准确性。该方法通过结合一种质量控制方法来解决生成低质量合成样本的问题,该方法根据局部密度、安全级别以及与多数类的隔离度来评估样本的可靠性。在30个数据集上的实验表明,QC-SMOTE优于现有的过采样技术,在具有中度至严重类别不平衡的情况下,取得了更高的AUC-ROC和Macro F1分数。
-
AI模型在阿尔茨海默病早期检测方面展现出潜力
研究人员正在开发利用各种数据源进行阿尔茨海默病早期检测的先进AI模型。一项研究提出了一种多语言方法,在语音数据上使用Transformer模型,在英语、中文、阿拉伯语和印地语上达到了82%的F1分数,并具有实时筛查的潜力。另一篇论文利用来自ADNI数据集的临床生物标志物的可解释XGBoost分类器,达到了0.983的宏观AUC,并识别了关键的预测特征。此外,第三项研究探讨了大型语言模型(LLMs)从文本中检测AD的能力,经过微调的BE…
-
AI通过SMOTE过采样改进物联网入侵检测
研究人员开发了一种新方法,通过解决数据集中类别不平衡问题来改进物联网网络中的入侵检测。他们应用了合成少数类过采样技术(SMOTE)来平衡数据,实现了1.1的不平衡比。这种方法显著提高了对少数类攻击的检测能力,特别是对组合感染的攻击,这通过宏F1分数和混淆矩阵得以体现。Random Forest模型实现了0.9989的微平均F1分数和0.9794的宏F1分数,优于先前的方法。
-
新的CopulaSMOTE方法改进了糖尿病预测中的不平衡数据处理
研究人员开发了CopulaSMOTE,一种解决医疗预测模型中类别不平衡的新颖方法,特别适用于糖尿病等疾病。与传统的SMOTE等方法不同,该方法使用基于Copula的技术来更好地模拟生成合成数据时少数类中的依赖结构。在三个公开的糖尿病数据集上的评估表明,CopulaSMOTE可以提高少数类的恢复能力,尤其是在较大的数据集和特定的分类器上,尽管其有效性有所不同。
-
Python 库 imbalanced-learn 简化了类别不平衡处理
imbalanced-learn Python 库为解决机器学习数据集中的类别不平衡问题提供了一个全面的解决方案。它将各种重采样技术(如 SMOTE 和欠采样方法)整合到一个与 scikit-learn 兼容的单一包中。通过确保在交叉验证期间正确应用重采样,防止数据泄露并提高不平衡数据的模型性能,该库简化了构建稳健机器学习管道的过程。
-
混合量子-经典框架增强欺诈检测
研究人员开发了 Q-SYNTH,这是一个新颖的混合量子-经典框架,旨在解决信用卡欺诈检测中不平衡数据的挑战。该系统使用参数化量子电路作为生成器,并使用经典神经网络作为判别器来合成少数类欺诈样本。评估表明,Q-SYNTH 在统计保真度与真实欺诈数据以及下游欺诈检测性能的改进之间提供了有希望的平衡,在特定指标上优于一些经典基线。