Polars
PulseAugur coverage of Polars — every cluster mentioning Polars across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的 Rust 随机森林 'Fru' 比 scikit-learn 和 ranger 速度更快
一种新的基于 Rust 的随机森林实现 Fru 已开发完成并发表在 Software X 期刊上。该实现相比现有的流行库在性能和可扩展性方面都有显著提升。Fru 在 Python 中实现了 scikit-learn 几倍的速度,并且通常比 R 的 ranger 包快百分之几十,在特定用例中速度提升潜力可达几倍。该项目还引入了一种新颖的排列重要性实现,并为 Python 和 R 提供了绑定,可与 pandas 和 polars 等库无缝集成。
-
AI 团队使用 DuckDB、Polars 和 Parquet 简化数据管道
本文详细介绍了 AI 团队如何采用更高效的数据管道架构。它强调了使用 DuckDB、Polars 和 Apache Parquet 作为构建更快、更简单的数据处理系统的关键组件。该方法旨在取代传统的、更复杂的 ETL(提取、转换、加载)堆栈。
-
Ciaren 可视化编辑器可生成 Polars 和 Pandas 数据管道
Ciaren 是一款新的可视化编辑器,允许用户使用拖放界面构建数据处理管道。该工具同时支持 Polars 和 Pandas,并为管道生成独立的 Python 代码。这种方法旨在通过在每个步骤提供可视化预览来简化复杂的数据转换,从而降低出错的可能性,并使过程比传统脚本更透明。
-
使用自定义 Rust 表达式插件扩展 Polars 数据库
本文详细介绍了如何使用 Rust 表达式插件扩展 Polars 数据处理库。它为开发人员提供了一个分步指南,将用 Rust 编写的自定义逻辑集成到 Polars 中,从而增强其数据分析和处理能力。这种方法允许进行超越 Polars 内置功能的更高效、更专业的操作。
-
微调 LLM:领域专业化的三阶段流程
本文详细介绍了微调语言模型以使其专业化于特定领域的三个阶段的流程。第一阶段涉及使用 Docling 等工具进行文档转换,从各种文件类型中提取结构化内容。第二阶段使用像 OpenAI 的模型这样的大型“教师”模型,从提取的文档部分生成问答对。最后,使用 LoRA 等技术,并借助 Unsloth 或 mlx-tune 等加速库,在这些合成的问答对上微调一个较小的“学生”模型,使其能够在本地离线运行,充当领域专家。
-
fenic 使用 Rust 插件扩展 Polars 以进行 AI 管道操作
fenic 库开发了一种方法,通过使用 Rust 表达式插件来扩展 Polars DataFrame 引擎的自定义操作。这种方法解决了在使用 Python UDFs 进行 AI 和 LLM 管道任务(如文本分块、提示模板化和模糊匹配)时遇到的性能限制和组合问题。通过 pyo3-polars 将这些操作实现为 Rust 插件,fenic 将它们直接集成到 Polars 的表达式引擎中,从而实现更快、类型安全且更具组合性的数据处理管道。
-
开源A股量化工具将LLM用作助手而非预言家
一个名为tickflow-stock-panel的新开源项目为中国A股市场提供了一个自托管工作台,专注于筛选、监控和回测。该工具刻意避免AI驱动的选股,而是使用大型语言模型作为助手,用于生成筛选策略和市场回顾等任务。它强调在投资决策中保留人类的参与,并允许用户连接到任何兼容OpenAI的LLM端点,包括本地模型。
-
TDDA书籍第7章发布数据验证内容,tdda库v3.2增加Polars支持
TDDA书籍第7章,重点关注数据验证中的实际约束,现已在线发布。本章结束了数据验证部分,讨论了非表格数据、电子表格、测量正则化以及Pandera和Great Expectations等替代库。tdda库的最新版本v3.2现在为Polars数据帧提供了全面支持,增强了内存数据和Parquet、CSV等文件的功能,并改进了Windows的CI测试。
-
DuckDB 的速度解析:进程内执行与列式存储
DuckDB 是一种进程内分析型 SQL 数据库,因其易用性和出色的性能而迅速普及。它作为一个库运行,无需单独的服务器,简化了与应用程序的集成。本篇是深入探讨 DuckDB 内部机制的第一部分,解释了其设计选择,如列式存储、向量化和进程内执行,如何提升其速度,使其能够快速处理大型数据集,而无需大量基础设施。
-
四肢瘫痪开发者推出VibeETL,一款快速可视化数据工具
一位前数据科学家(现为四肢瘫痪者)开发了VibeETL,这是一款旨在替代Alteryx的可视化数据处理工具。该平台耗时三个月开发,强调速度和可扩展性,后端采用Polars和Rust,并使用自定义布局算法实现无延迟的用户界面。VibeETL还支持可扩展性,允许用户轻松集成自己的自定义工具和AI模型,社区测试的特定领域包括Gemini Vision AI集成和GPU加速。
-
tdda 数据验证库发布 v3.0,支持 Pandas 和 Polars
tdda 库是一套用于数据验证和测试的命令行工具,现已发布 3.0 版本。此次更新引入了对新版 Pandas 和 Polars 的支持,增强了 Parquet 文件处理能力,并包含了带 man 页的全面文档和一个相关的方法论书籍。该库有助于引用测试、自动测试生成以及更安全地处理平面文件,重点关注数据分析和机器学习工作流的可复现性。
-
Polars 数据工作流重写将处理时间从 61 秒缩短至 0.20 秒
一位数据科学家重写了一个真实世界的数据工作流,将 Pandas 切换到 Polars,从而获得了显著的速度提升。原始工作流使用 Pandas 需要 61 秒,而 Polars 版本仅用 0.20 秒即可完成。这一变化突显了一种新的数据处理方法,对 Python 数据科学社区产生了重大影响。
-
机器学习专家讨论自动化金融评论生成
r/MachineLearning 的一位用户正在寻求架构建议,以构建一个能够大规模自动生成精确、人类可读的每日交易归因评论的系统。核心挑战在于平衡确定性数学准确性(需要 Python 和 Polars 等工具)与 LLM 动态自然语言生成能力。用户正在探索代理工作流(LLM 编写和执行代码)或使用预计算数据和结构化提示等选项,并征求有关金融报告框架和设计模式的建议。
-
交互式 Pandas 练习提供实践数据分析机会
该资源提供了 101 个交互式练习,用于学习 Pandas 数据分析库。用户可以直接在网页浏览器中运行和编辑所有代码块,无需任何安装。练习涵盖了基础操作,如导入 Pandas、从各种数据结构创建 Series、操作索引、将 Series 合并到 DataFrame 以及计算描述性统计数据。