Catboost
PulseAugur coverage of Catboost — every cluster mentioning Catboost across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
机器学习模型在野火检测方面优于 GOES FDC
一篇新发表在 arXiv 上的研究介绍了一种使用 GOES ABI 图像进行野火检测的 CatBoost 机器学习模型。该模型在一个大型数据集上进行了训练,并证明其性能优于现有的 GOES 火灾探测与表征 (FDC) 产品。CatBoost 模型实现了更高的精确率、召回率和 F1 分数,能更早地探测到火灾,并且即使在夜间也能准确运行,这与 GOES FDC 不同。
-
新的LLM框架应对不断演变的支付欺诈检测
两篇新的研究论文介绍了一些用于检测复杂支付欺诈的框架,特别是在涉及具有支出能力的AI代理商的场景中。第一篇论文SR-Fraud提出了一个基于LLM的代理商,该代理商能够实时适应不断演变的欺诈策略,在一个生产基准上表现优于CatBoost等传统方法。第二篇论文Agentic Commerce Bench (ACB) 解决了AI代理商被合法行事的交易对手过度收费的欺诈问题,并引入了一个分类法、一个基准数据集和一个名为gordonguard…
-
表格深度学习模型与经典机器学习在土地覆盖分类中的比较
一篇新的研究论文比较了表格深度学习(TDL)模型与经典机器学习算法在城市土地覆盖分类方面的有效性。该研究使用了来自UCI机器学习存储库的ULC数据集,该数据集包含源自航空影像的表格特征。研究人员将逻辑回归、支持向量机、随机森林、XGBoost和Catboost等模型与TabNet、FT-Transformer、TabTransformer、TabSeq和1D CNN等TDL模型进行了基准测试。结果表明,虽然树模型表现良好,但TDL模型…
-
基础模型在行人拥挤预测方面表现不一
一项新近发表在arXiv上的研究评估了时间序列基础模型(FMs)在行人拥挤计数预测方面的有效性。该研究比较了七种不同的预测方法,包括季节性朴素法(Seasonal Naive)和梯度提升树(gradient-boosted trees)等传统方法,以及深度学习模型和两种基础模型(TimesFM和Chronos-2)。研究结果表明,尽管基础模型在数据丰富、具有季节性且上下文长的环境中表现良好,但像季节性朴素法(Seasonal Naiv…
-
机器学习模型提高网格作业调度效率
arXiv上发表的一篇新研究论文详细介绍了一种用于网格计算环境中预测作业运行时间的机器学习方法。该研究侧重于使用GWA-T-4 AuverGrid工作负载跟踪进行防泄露、感知调度器的预测。研究人员发现,CatBoost(一种梯度提升算法)在经过时间验证调优后,取得了最佳性能,R^2值为0.239。模拟显示,与先到先服务的方法相比,使用这些预测进行作业调度可以将平均等待时间减少50%以上。
-
基础模型需要针对糖尿病葡萄糖预测进行微调
一项发表在arXiv上的新研究评估了时间序列基础模型在连续血糖监测(CGM)预测中的有效性,特别是针对1型和2型糖尿病患者。研究发现,虽然零样本基础模型在性能上并未始终优于PatchTST等专业基线模型,但对Chronos-Bolt等模型进行微调可以显著提高预测精度。该研究还整合了多模态饮食背景,使用了一个名为CGMacros的框架,该框架与CGM数据结合使用时,显示出整体RMSE的降低以及餐后RMSE的更大幅度下降。
-
B2B客户转化预测新方法准确率达91%
研究人员开发了一种新的B2B客户转化预测方法,准确率达到91%。该方法包括将个人联系人聚合到B2B客户级别,生成特征,然后使用CatBoost模型进行预测。该框架还基于模型的洞察力,促进个性化营销活动推荐,以进一步促进转化。
-
客户支持推荐系统从梯度提升树迁移到深度学习
一篇研究论文详细介绍了将生产环境客户支持推荐系统从梯度提升树模型迁移到深度推荐架构的过程。由于产品目录的不断演变以及整合文本记录等多模态信号的需求,此次迁移是必要的。该论文概述了诸如将推荐重塑为成对二元预测、负采样以及对文本记录块进行注意力池化等技术,以维持推荐质量。与CatBoost基线相比,新的深度推荐方法在对话初期表现持平,在后期阶段表现更优。
-
新的 qshap 工具可分解梯度提升树的 R²
研究人员推出 qshap,一种用于分解梯度提升决策树中 R² 值的新方法。该工具在 R 和 Python 中可用,通过分析观测值的二次损失来量化单个特征对整体模型性能的贡献。qshap 支持 XGBoost、LightGBM 和 Catboost 等流行的 GBDT 实现,利用高效的 C++ 后端,并为遗忘树提供专门的加速。
-
LightGBM 无法拟合交互数据,而 CatBoost 可以
Reddit 的 r/MachineLearning 子版块上一位用户正在寻求理解,为什么 LightGBM 在拟合一个简单的玩具数据集时遇到困难,该数据集模拟了交互效应,而 CatBoost 却能完美处理。用户的实验涉及一个目标变量,该变量依赖于两个解释变量的交互。尽管创建了一个特定的交互变量 ('AB') 并将 LightGBM 配置为最小叶子大小,但模型未能达到完美拟合。相比之下,CatBoost 即使没有显式的交互特征,也表现…
-
AI模型利用可解释学习预测孟加拉国男性家庭暴力
研究人员开发了一种可解释的集成学习模型来预测孟加拉国的男性家庭暴力(MDV)。该研究通过从九个主要城市收集数据,解决了数据不平衡和可用性有限的挑战。他们提出的堆叠集成模型,使用ANN和CatBoost作为基础分类器,并以Logistic Regression作为元模型,达到了95%的准确率和99.29%的AUC。SHAP和LIME等可解释AI技术被用于提供模型决策过程的透明度,挑战了家庭虐待主要影响女性的观念,并强调了为男性受害者提供…
-
LLM 应用于飞行安全分析,提出新的 FlightLLM 方法
研究人员开发了 FlightLLM,这是一种使用大型语言模型 (LLM) 来解释飞行安全事件的新颖方法。该方法通过结合统计描述符和定性描述符,并引入 CatBoost 进行分类指导,解决了模态不一致和特定任务数据有限等挑战。对比式少样本学习策略和结构化提示嵌入了航空知识,使 FlightLLM 能够为硬着陆等复杂事件提供直接且合理的解释,这一点已在空客 A320 飞行样本数据集上得到证明。
-
新研究揭示表格基础模型的惊人泛化能力
新研究探讨了表格基础模型(TFMs)惊人的泛化能力,表明即使在单个真实表格上进行自监督预训练,也能实现强大的迁移学习。研究表明,TFMs的有用性更多地取决于任务和特征的数量和质量,而不是实例的数量。一篇论文提出了GEAR,一个两阶段的蒸馏框架,用于从TFMs创建轻量级、高效的预测器以进行生产部署,显著降低了延迟和内存成本,同时保持了高性能。另一项分析检查了TFMs在生产环境中的实际应用,测试了Google的TabFM在企业任务中的表现。
-
TabH2O基础模型统一表格预测任务
研究人员推出TabH2O,这是一种用于表格数据预测任务的新型基础模型。该模型使用上下文学习将分类和回归统一到单个前向传播中,提高了训练效率并降低了成本。TabH2O包含多项架构增强功能,包括用于统一训练的双头设计、具有稳定性改进的单阶段预训练,以及增强对无关特征鲁棒性的噪声感知预训练。在TALENT和TabArena等基准测试上的评估表明,TabH2O的性能与现有方法相比具有竞争力,并在TabArena上取得了最先进的成果。
-
新AI框架提升私募公司估值
研究人员开发了一种新颖的框架,使用集成树监督相似性学习来识别私募市场中的可比公司。该方法利用在私募公司估值上训练的CatBoost模型来创建一个考虑了共同估值驱动因素、非线性关系和缺失数据的相似性指标。该方法在一个大型私募公司数据集上进行了测试,与传统的基于距离和文本嵌入方法相比,在下游估值任务中表现出更高的性能。
-
机器学习模型在住宅能源数据有限时准确性下降
一项新近发表在arXiv上的研究比较了各种机器学习模型在使用有限输入数据估算住宅能源消耗方面的有效性。研究人员发现,虽然CatBoost等模型在使用全套特征时取得了高精度(ResStock的R2=0.90,RECS的R2=0.73),但在仅限于十个易于获取的输入时,性能显著趋同(RECS的R2=0.61,ResStock的R2=0.62)。然而,对于更同质化的房屋群体,减少输入的模型显示出更高的准确性,这表明尽管存在数据限制,有针对性…
-
新框架提供可解释的 AI 用于败血症预测
研究人员开发了一种使用时间序列电子健康记录 (EHR) 数据对败血症进行建模的新框架。该方法通过设计优先考虑可解释性,将数据表示为关系型,然后将其命题化为人类可读的特征。所得模型,即选择性分数朴素贝叶斯分类器,在 MIMIC-III 数据集上实现了与 XGBoost 和 CatBoost 等最先进方法相媲美的性能,同时保持显著更小的模型占地面积,并在多个级别提供原生的可解释性。
-
新的“分裂候选缩放”参数揭示了梯度提升决策树中的双重下降现象
研究人员为梯度提升决策树(GBDTs)识别出了一种新的容量参数,称为分裂候选缩放(split-candidate scaling),该参数可能导致一种称为双重下降(double descent)的现象。与神经网络不同,GBDTs一直缺乏一个清晰的单轴容量参数。这种新方法涉及调整分裂候选的数量,从而细化特征量化网格并扩展用于提升更新的可用路径。使用XGBoost、LightGBM和Catboost进行的实验表明,增加分裂候选的数量会导致…
-
AI系统利用战术画像预测足球比赛结果,表现优于传统方法
研究人员开发了Sim2Win,一个新颖的框架,用于在不依赖球队名称或身份的情况下预测足球比赛结果和分析球队战术。该系统利用基于事件的数据来构建战术画像和识别打法,对未见过的球队表现出强大的泛化能力。评估显示,Sim2Win的表现优于ELO和Pi-Rating等传统方法,其中CatBoost在评估模型中取得了最高的准确率。
-
表格基础模型展现出潜力但面临部署障碍
近期研究表明,表格基础模型(TFMs),如TabPFN和TabFM,在表格机器学习任务上表现强劲,有时甚至超越XGBoost等传统梯度提升模型。然而,这些先进模型在实际部署中面临挑战,包括巨大的内存和计算资源需求。研究还显示,TFMs在面对分布外数据时性能会下降,这是现实世界场景中常见的问题,尽管它们与分布内数据的性能关系仍然成立。