PulseAugur
实时 06:37:25
实体 Catboost

Catboost

PulseAugur coverage of Catboost — every cluster mentioning Catboost across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 37
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 34
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 37 条
  1. COMMENTARY · CL_214909 ·

    LightGBM 无法拟合交互数据,而 CatBoost 可以

    Reddit 的 r/MachineLearning 子版块上一位用户正在寻求理解,为什么 LightGBM 在拟合一个简单的玩具数据集时遇到困难,该数据集模拟了交互效应,而 CatBoost 却能完美处理。用户的实验涉及一个目标变量,该变量依赖于两个解释变量的交互。尽管创建了一个特定的交互变量 ('AB') 并将 LightGBM 配置为最小叶子大小,但模型未能达到完美拟合。相比之下,CatBoost 即使没有显式的交互特征,也表现…

  2. TOOL · CL_208618 ·

    AI模型利用可解释学习预测孟加拉国男性家庭暴力

    研究人员开发了一种可解释的集成学习模型来预测孟加拉国的男性家庭暴力(MDV)。该研究通过从九个主要城市收集数据,解决了数据不平衡和可用性有限的挑战。他们提出的堆叠集成模型,使用ANN和CatBoost作为基础分类器,并以Logistic Regression作为元模型,达到了95%的准确率和99.29%的AUC。SHAP和LIME等可解释AI技术被用于提供模型决策过程的透明度,挑战了家庭虐待主要影响女性的观念,并强调了为男性受害者提供…

  3. TOOL · CL_208389 ·

    LLM 应用于飞行安全分析,提出新的 FlightLLM 方法

    研究人员开发了 FlightLLM,这是一种使用大型语言模型 (LLM) 来解释飞行安全事件的新颖方法。该方法通过结合统计描述符和定性描述符,并引入 CatBoost 进行分类指导,解决了模态不一致和特定任务数据有限等挑战。对比式少样本学习策略和结构化提示嵌入了航空知识,使 FlightLLM 能够为硬着陆等复杂事件提供直接且合理的解释,这一点已在空客 A320 飞行样本数据集上得到证明。

  4. RESEARCH · CL_203068 ·

    新研究揭示表格基础模型的惊人泛化能力

    新研究探讨了表格基础模型(TFMs)惊人的泛化能力,表明即使在单个真实表格上进行自监督预训练,也能实现强大的迁移学习。研究表明,TFMs的有用性更多地取决于任务和特征的数量和质量,而不是实例的数量。一篇论文提出了GEAR,一个两阶段的蒸馏框架,用于从TFMs创建轻量级、高效的预测器以进行生产部署,显著降低了延迟和内存成本,同时保持了高性能。另一项分析检查了TFMs在生产环境中的实际应用,测试了Google的TabFM在企业任务中的表现。

  5. TOOL · CL_200216 ·

    TabH2O基础模型统一表格预测任务

    研究人员推出TabH2O,这是一种用于表格数据预测任务的新型基础模型。该模型使用上下文学习将分类和回归统一到单个前向传播中,提高了训练效率并降低了成本。TabH2O包含多项架构增强功能,包括用于统一训练的双头设计、具有稳定性改进的单阶段预训练,以及增强对无关特征鲁棒性的噪声感知预训练。在TALENT和TabArena等基准测试上的评估表明,TabH2O的性能与现有方法相比具有竞争力,并在TabArena上取得了最先进的成果。

  6. TOOL · CL_200019 ·

    新AI框架提升私募公司估值

    研究人员开发了一种新颖的框架,使用集成树监督相似性学习来识别私募市场中的可比公司。该方法利用在私募公司估值上训练的CatBoost模型来创建一个考虑了共同估值驱动因素、非线性关系和缺失数据的相似性指标。该方法在一个大型私募公司数据集上进行了测试,与传统的基于距离和文本嵌入方法相比,在下游估值任务中表现出更高的性能。

  7. TOOL · CL_193829 ·

    机器学习模型在住宅能源数据有限时准确性下降

    一项新近发表在arXiv上的研究比较了各种机器学习模型在使用有限输入数据估算住宅能源消耗方面的有效性。研究人员发现,虽然CatBoost等模型在使用全套特征时取得了高精度(ResStock的R2=0.90,RECS的R2=0.73),但在仅限于十个易于获取的输入时,性能显著趋同(RECS的R2=0.61,ResStock的R2=0.62)。然而,对于更同质化的房屋群体,减少输入的模型显示出更高的准确性,这表明尽管存在数据限制,有针对性…

  8. TOOL · CL_193659 ·

    新框架提供可解释的 AI 用于败血症预测

    研究人员开发了一种使用时间序列电子健康记录 (EHR) 数据对败血症进行建模的新框架。该方法通过设计优先考虑可解释性,将数据表示为关系型,然后将其命题化为人类可读的特征。所得模型,即选择性分数朴素贝叶斯分类器,在 MIMIC-III 数据集上实现了与 XGBoost 和 CatBoost 等最先进方法相媲美的性能,同时保持显著更小的模型占地面积,并在多个级别提供原生的可解释性。

  9. RESEARCH · CL_183325 ·

    新的“分裂候选缩放”参数揭示了梯度提升决策树中的双重下降现象

    研究人员为梯度提升决策树(GBDTs)识别出了一种新的容量参数,称为分裂候选缩放(split-candidate scaling),该参数可能导致一种称为双重下降(double descent)的现象。与神经网络不同,GBDTs一直缺乏一个清晰的单轴容量参数。这种新方法涉及调整分裂候选的数量,从而细化特征量化网格并扩展用于提升更新的可用路径。使用XGBoost、LightGBM和Catboost进行的实验表明,增加分裂候选的数量会导致…

  10. TOOL · CL_171870 ·

    AI系统利用战术画像预测足球比赛结果,表现优于传统方法

    研究人员开发了Sim2Win,一个新颖的框架,用于在不依赖球队名称或身份的情况下预测足球比赛结果和分析球队战术。该系统利用基于事件的数据来构建战术画像和识别打法,对未见过的球队表现出强大的泛化能力。评估显示,Sim2Win的表现优于ELO和Pi-Rating等传统方法,其中CatBoost在评估模型中取得了最高的准确率。

  11. RESEARCH · CL_169746 ·

    表格基础模型展现出潜力但面临部署障碍

    近期研究表明,表格基础模型(TFMs),如TabPFN和TabFM,在表格机器学习任务上表现强劲,有时甚至超越XGBoost等传统梯度提升模型。然而,这些先进模型在实际部署中面临挑战,包括巨大的内存和计算资源需求。研究还显示,TFMs在面对分布外数据时性能会下降,这是现实世界场景中常见的问题,尽管它们与分布内数据的性能关系仍然成立。

  12. TOOL · CL_156309 ·

    新的 FALCON-Discover 框架识别出人工智能预测中危险的过度自信

    研究人员推出了一种新的事后框架 FALCON-Discover,旨在识别和排序表现出错误置信的预测。该方法侧重于发现过度自信错误的集中区域,而不是对校准进行汇总评估。在各种表格数据集和 XGBoost、Catboost 等强大的学习模型上,FALCON-Discover 在识别危险错误方面表现优于传统的校准方法,最佳检测策略因数据集特征而异。

  13. TOOL · CL_154344 ·

    机器学习模型在电力需求预测方面进行基准测试

    一项新的基准研究评估了十种机器学习模型在新英格兰地区的短期电力需求预测能力,利用了天气、日历和 COVID-19 数据。研究发现,梯度提升树模型(特别是 CatBoost 和 XGBoost)的表现优于 LSTMs 和 Transformers 等独立的神经网络架构。分析表明,历史需求数据是最重要的预测因子,而 COVID-19 指标的纳入显示出时间有效性衰减的迹象。

  14. TOOL · CL_154200 ·

    机器学习模型在诊断多囊卵巢综合征方面显示出潜力

    研究人员调查了使用机器学习技术诊断多囊卵巢综合征(PCOS)的应用。该研究探讨了多种特征选择方法,包括CatBoost、XGBoost、LightGBM、AdaBoost和Random Forest,以识别PCOS的关键指标。研究结果表明,AdaBoost模型结合了通过Random Forest特征重要性和最高相关性选择的特征后,在预测该病症方面取得了最高的测试准确率。

  15. TOOL · CL_154132 ·

    机器学习模型用于基于多组学数据的乳腺癌预测进行基准测试

    研究人员使用多组学数据对几种机器学习模型进行基准测试,以预测乳腺癌的雌激素受体(ER)状态。研究发现,RNA表达数据提供了最强的预测信号,多组学整合提供了适度但持续的改进。在测试的模型中,当整合转录组学、基因组学和蛋白质组学数据时,随机森林(Random Forest)表现最佳,实现了90.3%的平衡准确率和97.1%的ROC-AUC。模型还强调了ESR1和PGR等基因的重要性,进一步证实了它们在ER状态预测中的生物学相关性。

  16. TOOL · CL_147689 ·

    开源ML-IDS使用CatBoost进行网络攻击检测

    一个名为ML-IDS的新型开源网络入侵检测系统已被开发出来,它利用CatBoost算法对网络流量进行分类。与通常会过度拟合IP地址和端口等瞬态特征的传统方法不同,ML-IDS侧重于来自第三层和第四层流量的行为启发式方法,例如数据包大小、TTL、协议和TCP标志。这种方法旨在解决训练环境中常见的验证准确率高但无法检测现实世界攻击的问题。

  17. TOOL · CL_141597 ·

    机器学习框架通过客户流失预测和细分优化电信营销

    开发了一个新的机器学习框架,通过预测客户流失和根据客户价值及流失风险进行客户细分,帮助电信公司优化营销策略。该框架利用 CatBoost、XGBoost 和 LightGBM 等梯度提升模型,在 IBM Telco Customer Churn 数据集上取得了出色的性能指标。通过将客户流失预测与使用 k-means 聚类和主成分分析的客户细分相结合,该系统识别出四个可操作的客户群体,从而能够设计量身定制的客户保留和参与策略,重点是最大…

  18. TOOL · CL_128920 ·

    新AI框架通过可解释性增强胸部X光片分类

    研究人员开发了PulmoSight-XAI,一个用于胸部X光片分类的新颖框架,解决了类别不平衡和特征丢失等挑战。该系统利用多视图注意力集成和梯度提升元学习,并结合了卷积块注意力模块和混合损失函数等技术。在大型数据集上进行评估,PulmoSight-XAI取得了最先进的性能,并通过可解释性分析展示了强大的解剖学一致性。

  19. TOOL · CL_121151 ·

    基础模型与放射组学在肺部CT分析中的基准测试

    一篇新发布的arXiv基准研究,将基础模型与传统的放射组学技术在肺部CT扫描分析方面进行了比较。该研究评估了五种特征提取器、七种分类头和三种分割方法,涵盖了肿瘤分类和生存预测等五个任务。研究结果表明,分割对于体积和分期分类至关重要,而分类器的选择显著影响生存和组织学预测。研究建议在临床任务中,默认采用Curia结合肿瘤分割和CatBoost的流程,并在缺乏肿瘤描绘时提供替代方案。

  20. TOOL · CL_121180 ·

    实体嵌入在高基数欺诈检测基准测试中领先

    一篇新的研究论文探讨了不同类别编码方法在高基数欺诈检测中的有效性。该研究在IEEE-CIS欺诈基准数据集上测试了七种编码器,并使用LightGBM和CatBoost学习器比较了它们的性能。实体嵌入达到了最高的AUC-ROC得分,紧随其后的是CatBoost,并且显著优于层级分组编码。然而,在AUC-PR方面,CatBoost领先,表明没有一种编码器在两项指标上都占主导地位。研究表明,实体嵌入由于能够捕获联合多列表示而具有优势。