scikit-learn
PulseAugur coverage of scikit-learn — every cluster mentioning scikit-learn across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
10 个用于 Raspberry Pi 编码代理的必备 Python 软件包
本文为希望将 Raspberry Pi 转变为专用编码代理的用户提供了一个精选的 10 个必备 Python 软件包列表。它重点介绍了可增强 Pi 在开发任务中的功能的工具,涵盖了从数据科学到 Web 应用程序框架的领域。
-
新的Python库skchange简化了时间序列变点检测
一个名为skchange的新开源Python库已发布,用于检测时间序列数据中的结构性变化。它为各种现代变点检测算法提供了一个统一的框架,包括基于成本最小化和统计检验的方法。该库旨在实现高计算性能,利用Numba,并遵循scikit-learn约定,以便于使用和贡献。
-
新AI方法优化受限观测下的表示选择
一篇新论文提出了一种用于在受限观测下运行的AI系统的验证前沿选择器,旨在优化超越原始准确率的表示选择。该方法纳入了特征成本、过拟合和验证-测试不稳定性等惩罚项。在使用scikit-learn数据集的基准测试中,自适应选择器在鲁棒性-效率前沿得分方面有所提高,同时显著降低了平均特征数量,尽管平衡准确率的差异在统计学上不显著。
-
新的 AutoML 框架使用 LLM 进化可执行的 Python 管道
研究人员开发了 LACE,一个新颖的 AutoML 框架,它利用大型语言模型作为变异算子来进化完整的可执行管道程序。与在预定义组件空间内搜索的传统 AutoML 系统不同,LACE 生成并维护一个 scikit-learn 兼容的 Python 类群。这种方法允许直接检查和编辑生成的管道。在 68 个 OpenML 分类任务上的评估表明,由 GPT-5.4-mini 驱动的 LACE,其性能显著优于 auto-sklearn、H2O …
-
发布新的 SpotOptim Python 包用于黑盒函数优化
SpotOptim Python 包已发布,为优化昂贵的黑盒函数提供了一个框架。它采用基于 Kriging 的方法和预期改进(Expected Improvement),支持各种变量类型、带噪声的评估和多目标优化。该包包含诸如基于成功率的重启机制以防止停滞等功能,并与 scikit-learn 兼容的代理模型集成。SpotOptim 还提供 TensorBoard 日志记录以进行实时监控,并与其他几个流行的优化工具进行了比较。
-
新的Python库使用形式概念分析可视化欧洲歌唱大赛获胜者数据
研究人员开发了ConceptFlow,一个与scikit-learn兼容的Python库,专为形式概念分析而设计。该工具可以从复杂数据上下文中构建和可视化嵌套线图。该库被应用于分析1975年至2025年的欧洲歌唱大赛获胜者,考察投票模式与音乐属性之间的相互作用。
-
树莓派成为原生边缘计算机器学习气象站
一个项目已将树莓派 Zero 2 W 和 Sense HAT V2 改造成了一个独立的、原生边缘计算的机器学习气象站。该设置在没有云连接或重型机器学习框架的情况下运行,利用纯 NumPy 实现进行高级统计建模,包括卡尔曼滤波和共形预测。该系统持续更新其本地大气模型,生成校准的不确定性区间,并在 Sense HAT 的 LED 矩阵上显示动画预测,整个项目是开源的。
-
在机器学习模型中分箱连续变量会丢失大量信号
在机器学习模型中分箱连续变量,例如将年龄划分为离散类别,会显著降低模型的预测能力。研究表明,即使是简单的中位数分割也会丢弃数据集中约36%的信息。这种做法会在存在平滑关系的地方产生人为的不连续性,可能导致模型性能不佳和可利用的决策边界。
-
Scikit-learn 1.9.0 通过新的 Narwhals 依赖项增强 DataFrame 互操作性
Scikit-learn 1.9.0 版本于 2026 年 6 月 2 日发布,引入了超出典型更新的重大变化。一项关键发展是增加了 Narwhals 作为依赖项,旨在增强跨各种 DataFrame 库的互操作性。此版本还将支持扩展到 Python 3.11 至 3.14,提供更现代的运行时环境。建议开发人员仔细检查其机器学习管道的兼容性,因为此更新会影响 NumPy、SciPy 和 joblib 等工具的更广泛生态系统。
-
新的 Rust 随机森林 'Fru' 比 scikit-learn 和 ranger 速度更快
一种新的基于 Rust 的随机森林实现 Fru 已开发完成并发表在 Software X 期刊上。该实现相比现有的流行库在性能和可扩展性方面都有显著提升。Fru 在 Python 中实现了 scikit-learn 几倍的速度,并且通常比 R 的 ranger 包快百分之几十,在特定用例中速度提升潜力可达几倍。该项目还引入了一种新颖的排列重要性实现,并为 Python 和 R 提供了绑定,可与 pandas 和 polars 等库无缝集成。
-
Scikit-learn:驱动预测分析的Python库
本文聚焦于scikit-learn,一个对数据科学和机器学习至关重要的Python库。文章强调了该库在经典机器学习中的重要性,而经典机器学习是预测分析和生产AI系统的基石。本文是探索数据科学必备Python库系列文章的一部分。
-
MLOps 详解:弥合从 Notebook 到生产的鸿沟
本文介绍了 MLOps,解释了它始于 Jupyter 等传统 Notebook 环境的终结之处。文章重点介绍了将在系列文章中涵盖的实际方面和代码示例,侧重于从开发环境到生产环境的过渡。
-
AI 可复现性需要的不只是数据;模型、运行时和权限是关键
仅复制数据不足以完全复现 AI 模型运行。密封的数据状态确认了输入,但要完全复现,还需要原始执行时使用的特定模型版本、运行时环境、必要工具以及确切的权限。这种全面的方法确保了生产 AI 系统的真正可复现性。
-
新的 Python 库连接分子机器学习与 scikit-learn
一个名为 scikit-fingerprints 的新 Python 库已发布,旨在将分子机器学习功能与 scikit-learn 生态系统集成。该库基于 RDKit 构建,为分子指纹、相似性度量和数据拆分策略提供了一个统一的接口,旨在简化分子机器学习工作流程的原型设计、复现和部署。目标是使这些化学信息学工具更容易获得,并与更广泛的 Python 机器学习领域兼容。
-
MLflow 教程引导用户了解实验跟踪基础知识
本教程系列介绍了 MLflow,一个用于管理机器学习生命周期的开源平台。第一部分侧重于 MLflow Tracking,演示如何记录实验、参数、指标和模型。通过使用 MLflow,用户可以摆脱分散的笔记本和结果,转向一个集中的模型训练跟踪系统,从而实现可重复性和更轻松地比较不同的模型配置。
-
TimesFM 2.5 凭借新功能增强时间序列预测能力
时间序列预测模型 TimesFM 2.5 已更新,加入了用于端到端工作流开发的先进功能。新版本支持回测、协变量集成、异常检测和可扩展部署。用户现在可以使用各种指标评估预测质量,并在不同场景下测试模型的鲁棒性,包括长周期预测和输入变化。
-
开发者构建本地LLM评估工具,准确率达75%
一位开发者创建了一个名为LLM Judge的开源工具,用于评估大型语言模型(LLM)的输出,特别是在编码任务方面。该工具通过模型输出与参考答案之间的语义相似性来绕过传统方法,如执行代码或使用另一个LLM(如GPT-4)。LLM Judge在Hugging Face数据集上进行训练,在未见过的数据集上的编码问题上达到了约75%的准确率,并与人类裁判的判断有约58%的一致性,同时完全在本地运行且无API调用成本。
-
Python在人工智能和数据科学中对专业人士的必备作用
到2026年,Python仍然是主要的编程语言,尤其是在人工智能和数据科学领域,这得益于其可移植性以及与TensorFlow和PyTorch等关键库的集成。金融、人力资源、市场营销和医疗保健等各个领域的专业人士都可以利用特定的Python技能来自动化任务、构建预测模型并更有效地分析数据。在快速增长的人工智能就业市场中,掌握与自己领域相关的必要Python组件而不是整个语言,对于职业发展至关重要,该市场提供了显著的工资溢价。
-
MLOps:弥合模型开发与生产之间的差距
本文讨论了将机器学习模型从Jupyter Notebook等开发环境迁移到生产环境的挑战。文章强调,虽然训练模型是一项重大成就,但确保模型在实际环境中可靠、安全且长期运行需要强大的MLOps实践。文章强调了这一转变所涉及的复杂性,并指出训练后阶段通常是机器学习生命周期中最困难的部分。
-
AWS 详解 AI 驱动的银行推荐系统及其可解释的洞察
AWS 详细介绍了一个专为银行业量身定制的可解释的“下一个最佳产品”推荐系统的架构。该系统利用 Amazon SageMaker AI 和 PyTorch 来预测客户最有可能需要的产品。它采用带有学习到的注意力机制的多塔神经网络来提高准确性并提供每个客户的可解释性,从而克服了传统推荐方法的局限性。