PulseAugur
实时 06:11:30
实体 gradient boosting

gradient boosting

PulseAugur coverage of gradient boosting — every cluster mentioning gradient boosting across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 26
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_206684 ·

    新系统利用人工智能模型估算孟加拉国街头食品热量

    研究人员开发了一个基于视觉的系统,用于估算孟加拉国街头食品的热量含量,填补了当前以西方为中心的做法中的空白。该研究比较了五种物体检测和分割模型,其中YOLO11n取得了最高的检测性能。对于热量预测,一个随机森林回归模型利用YOLO11n提取的几何特征和一个孟加拉国5塔卡硬币作为比例参考,取得了最佳结果,平均绝对误差为5.68。

  2. TOOL · CL_200163 ·

    论文提出可解释人工智能以实现可信赖的热需求预测

    一篇新论文介绍了一种事前的可解释人工智能方法,用于评估用于热需求预测的机器学习模型的全局特征重要性。该研究旨在提高这些模型的可解释性和可信赖性,以解决与标准、客户满意度和责任相关的问题。该方法采用四种方法:梯度提升的内在可解释性以及部分依赖、累积局部效应和SHAP等事后方法,而不依赖于特征排列或扰动。

  3. TOOL · CL_198179 ·

    Forma transformer 模型可预测未来 20 个季度的财务报表

    研究人员开发了 Forma,这是一种基于 transformer 的新型模型,能够预测未来长达 20 个季度的完整财务报表。在最新发布的 ProForma-20Q 基准测试中,Forma 的表现显著优于包括梯度提升和大型语言模型在内的各种经典机器学习技术。该基准测试要求预测 78 个财务报表项目,并以变化空间 R^2 进行评分,Forma 在对估值至关重要的长预测周期方面表现尤为出色。

  4. TOOL · CL_197653 ·

    梯度提升处理不平衡数据:加权、重采样和校准

    本文讨论了处理不平衡分类问题的策略,特别是在XGBoost等梯度提升模型背景下。文章指出,一个常见的问题并非模型无法学习少数类,而是分类时使用的默认阈值0.5不当,这可能导致所有正例都被遗漏。作者建议,虽然类加权(例如在XGBoost中使用`scale_pos_weight`)和SMOTE等重采样技术可以帮助模型学习少数类,但它们也可能对概率校准产生负面影响。文章强调,业务背景,特别是假阴性与假阳性的成本比,应驱动决策,并且如果下游使…

  5. COMMENTARY · CL_197654 ·

    梯度提升预测成本由树的数量驱动,而非特征数量

    本文详细介绍了大规模运行梯度提升预测的成本,强调模型中的树的数量是计算成本的主要驱动因素,而不是特征的数量。作者提供了一个成本模型,显示使用800棵树对5000万行数据进行评分,每晚约花费0.13美元,或每年49美元,假设了特定的计算价格和吞吐量。调整学习率等超参数会显著增加树的数量,从而增加成本,即使准确性提升很小。

  6. TOOL · CL_193868 ·

    谷歌地图兴趣点用于估算圣保罗市收入

    研究人员开发了一种方法,通过分析谷歌地图兴趣点(POIs)的众包数据,在巴西圣保罗市次级市政层面估算家庭收入。该方法利用谷歌地图的兴趣点类别来创建高频、低成本的收入代理,解决了巴西十年一次的普查频率低且成本高昂的局限性。表现最佳的模型结合了非负矩阵分解和梯度提升,在预测普查得出的收入时达到了0.65的R^2,表明地理空间数据可以有效地补充传统的收入统计数据。

  7. TOOL · CL_193814 ·

    新的电子健康记录框架改进了围手术期结局预测

    研究人员开发了一种新的域结构集成框架,用于使用电子健康记录(EHR)数据预测围手术期结局。该框架将预测因子组织到患者、手术和麻醉域中,域特定的梯度提升模型通过逻辑回归元学习器整合它们的风险估计。在预测术后谵妄的测试中,该系统达到了 0.899 的 AUROC,优于单阶段模型,并显示出出色的校准和时间验证。

  8. TOOL · CL_187388 ·

    新的基准MS-MLB使用机器学习进行基于血液的MS分类

    研究人员推出了MS-MLB,这是一个新的开放基准,用于使用全血RNA表达数据对多发性硬化症(MS)进行机器学习分类。该基准利用了公开的GSE17048队列,并实施了一个严格、可复现的管道,并控制了数据泄露,以评估各种算法。梯度提升模型表现最佳,在保留集上取得了93.83的高MS研究分数和0.989的AUC-ROC,但这些分数仅用于研究比较,未经临床验证。

  9. TOOL · CL_187239 ·

    混合机器学习框架预测放牧系统中的牛增重

    研究人员开发了一个混合机器学习框架,用于预测放牧系统中的牛增重和生长模式。该框架整合了各种传感数据,包括活重、人口统计学和环境因素,以预测牛群水平的轨迹。结合梯度提升、随机森林和神经网络的级联架构表现出卓越的性能,R^2 达到 0.889,并且优于传统的循环模型,尤其是在数据稀疏的情况下。

  10. TOOL · CL_151971 ·

    机器学习模型显示,COVID-19后医疗保健财务脆弱性的稳定预测因素

    一项新研究分析了美国2019年和2021年的医疗支出面板调查数据,以评估COVID-19大流行前后美国的医疗保健财务脆弱性。研究人员将高财务负担定义为自付医疗费用超过家庭收入的10%。分析采用了逻辑回归、随机森林和梯度提升模型,发现贫困状况、保险覆盖和处方药支出是财务脆弱性的关键预测因素。尽管差异依然存在,但在大流行前数据上训练的模型对大流行后数据仍具有显著的预测能力,表明财务压力的核心预测因素是稳定的。

  11. RESEARCH · CL_146909 ·

    经典机器学习方法在检测大型语言模型生成的文本方面显示出潜力

    研究人员正在探索使用传统的机器学习模型来检测大型语言模型(LLM)生成的文本。与深度学习方法相比,支持向量机和朴素贝叶斯分类器等经典方法在可解释性和效率方面具有优势。虽然目前的经典模型在F1分数上达到了78%-90%的检测准确率,但它们仍然落后于达到97%的深度学习模型。然而,经典方法在实时应用和作为更复杂的深度学习检测器的补充系统方面仍然具有价值。

  12. RESEARCH · CL_141189 ·

    量子机器学习框架 Q^2SAR 提高药物发现准确性

    研究人员开发了一个名为 Q^2SAR 的新量子多核学习 (QMKL) 框架,旨在通过克服经典定量结构-活性关系 (QSAR) 建模的局限性来增强药物发现。这种量子增强方法利用量子支持向量机 (QSVM) 将分子描述符编码到更大的量子希尔伯特空间中,提高了非线性建模的表现力。在针对阿尔茨海默病相关 DYRK1A 激酶的测试中,Q^2SAR 取得了 0.8750 的 AUC 分数,显著优于得分为 0.8037 的经典梯度提升模型。

  13. TOOL · CL_139620 ·

    机器学习模型预测电力通信网络中的级联故障

    研究人员开发了一种机器学习代理模型,用于预测相互依赖的电力和通信网络中的级联故障。该模型利用梯度提升,与高保真模拟器实现了高度相关性,从而能够快速对关键组件进行排序,以加强基础设施的韧性。该代理模型通过整合层间依赖信息来提高有效性,其性能优于传统的拓扑中心性度量。

  14. RESEARCH · CL_135211 ·

    LSTM模型在Twitter感情分析中优于传统方法 · 跟踪2个来源

    研究人员在arXiv上发表了一项研究,比较了各种机器学习和深度学习模型在Twitter数据感情分析中的有效性。该研究评估了逻辑回归、随机森林、朴素贝叶斯、梯度提升和长短期记忆(LSTM)网络。LSTM模型表现出卓越的性能,训练准确率为90.98%,测试准确率为80.00%,微平均ROC-AUC得分为0.92,在捕捉上下文和顺序文本细微差别方面优于传统的机器学习方法。

  15. TOOL · CL_128920 ·

    新AI框架通过可解释性增强胸部X光片分类

    研究人员开发了PulmoSight-XAI,一个用于胸部X光片分类的新颖框架,解决了类别不平衡和特征丢失等挑战。该系统利用多视图注意力集成和梯度提升元学习,并结合了卷积块注意力模块和混合损失函数等技术。在大型数据集上进行评估,PulmoSight-XAI取得了最先进的性能,并通过可解释性分析展示了强大的解剖学一致性。

  16. TOOL · CL_121178 ·

    新框架增强了基于调查的研究的稳健性分析

    本文介绍了一种分析基于调查的研究结果稳健性的新颖框架。它整合了结构方程模型(SEM)、双重机器学习(DML)和普通最小二乘(OLS)回归,以评估不同估计技术下关系保持的稳定性。该方法论在金融科技数字客户亲密度模型上进行了演示,帮助研究人员识别哪些发现得到了持续支持,哪些需要更谨慎的解释。

  17. RESEARCH · CL_117342 ·

    重采样方法会降低模型校准能力,但重新校准可提供解决方案

    一篇新发表在arXiv上的研究论文探讨了重采样方法对树集成模型概率校准能力的影响。研究发现,虽然SMOTE(合成少数类过采样技术)会导致校准能力轻微下降,但随机欠采样会带来重大风险,尤其是在高不平衡比率下,它会扭曲训练数据,使概率估计不可靠。幸运的是,像Platt或等渗缩放这样的事后重新校准技术可以有效消除这种校准损害,同时对判别性能的影响极小。

  18. RESEARCH · CL_117192 ·

    梯度提升扩展至向量值函数 · arXiv 研究

    研究人员开发了一种新颖的梯度提升方法,将其能力扩展到向量值函数。这种新方法解决了现有框架的局限性,这些框架通常通过一次处理一个元素或使用简化的近似来处理向量目标。所提出的算法旨在与基于直方图的决策树高效工作,有可能提高复杂多类分类任务的性能。

  19. TOOL · CL_93621 ·

    机器学习模型难以在美元/加元汇率预测中胜过随机游走

    一项发表在arXiv上的新研究探讨了各种机器学习模型在预测美元/加元汇率方面相对于随机游走基准的有效性。研究人员发现,虽然大多数机器学习模型仅显示出边际改进,但线性回归是唯一在统计上优于朴素随机游走的模型。该研究使用了加拿大银行的每日数据,并将其重采样为月度观测值,采用了扩展窗口框架进行评估。SHAP分析被用于解释表现最佳的模型,结果显示短期滞后和近期滚动均值是主要的预测因子,这与汇率接近随机游走的性质一致。

  20. TOOL · CL_91440 ·

    机器学习结合气候数据预测塞拉利昂水稻产量

    一篇新发表在arXiv上的研究探讨了在数据受限环境下利用机器学习预测水稻产量的潜力,重点关注塞拉利昂。研究人员发现,仅使用作物统计数据训练的模型,其表现不优于简单的持续性预测。然而,当加入免费的卫星气候数据后,机器学习模型(特别是XGBoost)将预测误差显著降低了三分之一,并指出早期降雨是关键预测因子。研究还指出,过去的产量崩溃是由制度因素而非气候造成的,并基于这些发现提出了政策建议。