Pandas
PulseAugur coverage of Pandas — every cluster mentioning Pandas across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
Python 教程复现 LabPlot 数据分析工作流
本教程演示了如何使用受 LabPlot 启发的工作流在 Python 中进行科学数据分析。它涵盖了信号处理、峰拟合和可视化等基本数据处理技术,并利用了 NumPy、Pandas、Matplotlib 和 SciPy 等库。该工作流设计为可重用,并可扩展到批量处理以分析多个数据集,如在光谱学示例中所示。
-
10 个用于 Raspberry Pi 编码代理的必备 Python 软件包
本文为希望将 Raspberry Pi 转变为专用编码代理的用户提供了一个精选的 10 个必备 Python 软件包列表。它重点介绍了可增强 Pi 在开发任务中的功能的工具,涵盖了从数据科学到 Web 应用程序框架的领域。
-
新数据集捕获了来自 139k 个笔记本的真实世界 Pandas 工作流
研究人员推出 PandasCorpus,一个旨在系统研究真实世界 Pandas 工作流和使用模式的新数据集。该数据集从 GitHub 存储库中提取,包含 139,000 个 Jupyter 笔记本,捕获了超过 400 万次 Pandas API 调用。该研究分析了代码可执行性、笔记本大小以及常见的 Pandas 操作序列,提供了关于该库在实践中如何使用的经验性见解。PandasCorpus 旨在成为一个可重用的资源库,用于研究数据分析…
-
研究发现 Anthropic 的 Claude AI 编写的 Python 测试与人类编写的一样好
一篇新发布的 arXiv 研究论文评估了 Anthropic 的 Claude AI 模型(特别是 Sonnet 和 Opus 4.6 及更高版本)生成的 Python 测试的质量。研究发现,这些由 AI 生成的测试在质量上与 Django 和 Pandas 等成熟的开源项目中的人类编写的测试相当。评估采用了严格的协议,包括故障注入和定性设计评分标准,评估的是单个测试而非整个测试套件,以 pinpoint 改进的具体领域。
-
作者集成四个工具以增强 Claude Agent 功能
作者详细介绍了为内部团队使用的 Claude Agent 集成的四个工具。这些工具增强了该 Agent 的能力,每个添加的工具都因其对 Agent 功能的特定贡献而得到证明。该 Agent 是使用 Claude Code 和 Claude Agent SDK 构建的。
-
树莓派成为原生边缘计算机器学习气象站
一个项目已将树莓派 Zero 2 W 和 Sense HAT V2 改造成了一个独立的、原生边缘计算的机器学习气象站。该设置在没有云连接或重型机器学习框架的情况下运行,利用纯 NumPy 实现进行高级统计建模,包括卡尔曼滤波和共形预测。该系统持续更新其本地大气模型,生成校准的不确定性区间,并在 Sense HAT 的 LED 矩阵上显示动画预测,整个项目是开源的。
-
在机器学习模型中分箱连续变量会丢失大量信号
在机器学习模型中分箱连续变量,例如将年龄划分为离散类别,会显著降低模型的预测能力。研究表明,即使是简单的中位数分割也会丢弃数据集中约36%的信息。这种做法会在存在平滑关系的地方产生人为的不连续性,可能导致模型性能不佳和可利用的决策边界。
-
Scikit-learn 1.9.0 通过新的 Narwhals 依赖项增强 DataFrame 互操作性
Scikit-learn 1.9.0 版本于 2026 年 6 月 2 日发布,引入了超出典型更新的重大变化。一项关键发展是增加了 Narwhals 作为依赖项,旨在增强跨各种 DataFrame 库的互操作性。此版本还将支持扩展到 Python 3.11 至 3.14,提供更现代的运行时环境。建议开发人员仔细检查其机器学习管道的兼容性,因为此更新会影响 NumPy、SciPy 和 joblib 等工具的更广泛生态系统。
-
Pandora框架使用代码表示统一结构化知识推理
研究人员开发了Pandora,一个用于统一结构化知识推理(USKR)的新框架,旨在改进AI系统与表格和数据库等各种结构化数据源的交互方式。Pandora利用一种新颖的基于代码的知识表示,该表示基于Python的Pandas API,与大型语言模型的预训练非常契合。这种方法促进了对不同结构化知识源的统一处理,并通过知识转移来构建跨任务记忆,从而通过代码执行反馈实现自适应推理校正。在三个USKR任务的六个基准测试上的实验表明,Pandor…
-
OctoBot 教程详细介绍量化交易策略回测与优化
本教程详细介绍了使用 OctoBot 和 OctoBot-Script 创建和验证量化交易策略的过程。它概述了设置具有特定 RSI、EMA 和 ATR 参数的交易策略,然后在多个加密货币交易所上执行该策略的流程。工作流程包括前向回测、通过网格搜索进行参数优化以及样本外验证,以评估泛化能力并防止过拟合。最后,它涵盖了使用 Pandas 和 Plotly 进行交互式可视化的回测结果分析。
-
新的 Rust 随机森林 'Fru' 比 scikit-learn 和 ranger 速度更快
一种新的基于 Rust 的随机森林实现 Fru 已开发完成并发表在 Software X 期刊上。该实现相比现有的流行库在性能和可扩展性方面都有显著提升。Fru 在 Python 中实现了 scikit-learn 几倍的速度,并且通常比 R 的 ranger 包快百分之几十,在特定用例中速度提升潜力可达几倍。该项目还引入了一种新颖的排列重要性实现,并为 Python 和 R 提供了绑定,可与 pandas 和 polars 等库无缝集成。
-
MLOps 详解:弥合从 Notebook 到生产的鸿沟
本文介绍了 MLOps,解释了它始于 Jupyter 等传统 Notebook 环境的终结之处。文章重点介绍了将在系列文章中涵盖的实际方面和代码示例,侧重于从开发环境到生产环境的过渡。
-
Reflex XY Python 库增强交互式数据可视化
Reflex XY Python 库提供了创建交互式和可扩展数据可视化的高级功能。它支持组合模型以合并多个图表元素,通过自动切换到基于密度的渲染来处理大型数据集,并通过流式传输实现动态更新。该库还允许将浏览器交互连接回 Python,并提供自定义和扩展视觉组件的选项,可视化结果可导出为独立的 HTML、SVG 或 PNG 文件。
-
新框架CLARA澄清癌症基因组查询中的歧义
研究人员开发了CLARA,一个旨在澄清与癌症基因组学相关的自然语言查询中的歧义的框架。CLARA将自然语言问题转化为类型化的科学查询规范,评估多种解释,并在估计值显著不同时寻求用户澄清。在TCGA PanCancer Atlas上进行测试,CLARA在识别结果敏感对比方面表现出高准确性,平衡了安全性和用户负担。
-
AI 可复现性需要的不只是数据;模型、运行时和权限是关键
仅复制数据不足以完全复现 AI 模型运行。密封的数据状态确认了输入,但要完全复现,还需要原始执行时使用的特定模型版本、运行时环境、必要工具以及确切的权限。这种全面的方法确保了生产 AI 系统的真正可复现性。
-
TimesFM 2.5 凭借新功能增强时间序列预测能力
时间序列预测模型 TimesFM 2.5 已更新,加入了用于端到端工作流开发的先进功能。新版本支持回测、协变量集成、异常检测和可扩展部署。用户现在可以使用各种指标评估预测质量,并在不同场景下测试模型的鲁棒性,包括长周期预测和输入变化。
-
开发者构建本地LLM评估工具,准确率达75%
一位开发者创建了一个名为LLM Judge的开源工具,用于评估大型语言模型(LLM)的输出,特别是在编码任务方面。该工具通过模型输出与参考答案之间的语义相似性来绕过传统方法,如执行代码或使用另一个LLM(如GPT-4)。LLM Judge在Hugging Face数据集上进行训练,在未见过的数据集上的编码问题上达到了约75%的准确率,并与人类裁判的判断有约58%的一致性,同时完全在本地运行且无API调用成本。
-
Claude Code v2.1.220 支持 4GB 内存本地 Python 分析
Claude Code v2.1.220 提供了一种更有效的方式来处理本地 Python 数据分析任务,仅需 4GB 内存。该 AI 代理将文件 I/O 操作本地化,并将逻辑推理通过安全连接交给 Anthropic 的服务器处理。这种方法被认为是比云端数据处理的改进,并为用户提供了优化技巧,例如分块处理 CSV 文件以及在 Windows Subsystem for Linux 中配置内存限制。
-
Ciaren 可视化编辑器可生成 Polars 和 Pandas 数据管道
Ciaren 是一款新的可视化编辑器,允许用户使用拖放界面构建数据处理管道。该工具同时支持 Polars 和 Pandas,并为管道生成独立的 Python 代码。这种方法旨在通过在每个步骤提供可视化预览来简化复杂的数据转换,从而降低出错的可能性,并使过程比传统脚本更透明。
-
MLOps:弥合模型开发与生产之间的差距
本文讨论了将机器学习模型从Jupyter Notebook等开发环境迁移到生产环境的挑战。文章强调,虽然训练模型是一项重大成就,但确保模型在实际环境中可靠、安全且长期运行需要强大的MLOps实践。文章强调了这一转变所涉及的复杂性,并指出训练后阶段通常是机器学习生命周期中最困难的部分。