NumPy
PulseAugur coverage of NumPy — every cluster mentioning NumPy across labs, papers, and developer communities, ranked by signal.
- used by scikit-learn 70%
- used by SciPy 70%
- used by graphics processing unit 70%
- competes with Pascal 70%
- used by multilayer perceptron 70%
- used by Blas 70%
- used by Google Colab 70%
- used by Jupyter Notebook 70%
- affiliated with SciPy 60%
- instance of Project Jupyter 60%
- used by MLOps 60%
- used by central processing unit 60%
22 天有情绪数据
-
LLM 代币预算需要百分位数规划,而非平均值
本文认为,LLM 的代币额度应被视为一个随机变量,而不是一个固定数字。作者建议根据百分位数来规划预算,例如每次请求的代币消耗量的第 90 百分位数,而不是平均值。这种方法有助于考虑代币使用量的可变性,尤其是在长上下文请求的情况下,并为管理成本和避免意外超支提供更现实的估计。MonkeyCode 项目的免费套餐被强调为练习这种统计预算方法的合适环境。
-
SQL 数据库在 AI 代理记忆方面优于向量存储
虽然许多 AI 开发人员正在采用向量数据库来存储 LLM 记忆,但本文认为,对于大多数代理工作负载而言,传统的 SQL 数据库更高效、更简单。向量存储可能会引入延迟、运营开销以及不可预测的召回问题,尤其是在向量数量低于数千万的规模下。相反,SQL 数据库为结构化和时间数据提供了精确、有范围且确定的召回,使其成为需要基于时间或标签等标准获取特定信息的代理的更优选择。
-
Icepick 音频项目发布,支持可切换后端和 API 控制
Icepick 项目已完成,引入了包括 FFmpeg、Native 和 GStreamer 在内的可插拔音频后端,这些后端可以在运行时进行切换。该系统在 NumPy 中实现了交叉渐变,支持基于 SQLite 的调度并可根据情绪进行调整,以及在单个 Python 进程中进行端到端音频处理。用户可以通过 API 控制播放,并提供跳过、音量调整和实时后端切换的选项。
-
10 个用于 Raspberry Pi 编码代理的必备 Python 软件包
本文为希望将 Raspberry Pi 转变为专用编码代理的用户提供了一个精选的 10 个必备 Python 软件包列表。它重点介绍了可增强 Pi 在开发任务中的功能的工具,涵盖了从数据科学到 Web 应用程序框架的领域。
-
代码补全工具的幽灵文本功能因自预测差距而评估失败
一位开发者创建了一个名为 pycomplete 的代码补全工具,该工具结合了 transformer 模型、n-gram 模型和缓存。虽然该工具的下一个 token 预测准确率为 54.6%,但其生成“幽灵文本”(多 token 续写)的性能却显著下降至 7%,即十四次尝试中只有一次正确补全。这种差异的出现是因为评估指标是基于人类编写的代码进行训练的,而幽灵文本功能依赖于模型预测其自身生成的输出,这导致在评估这种不同分布时出现性能断崖。
-
使用NumPy从零开始构建决策树分类器
本文详细介绍了如何使用NumPy从零开始构建决策树分类器。文章解释说,决策树通过对输入特征提出一系列问题来缩小可能性范围并得出预测。构建此类树的核心在于递归地在每个节点找到最佳问题,将数据分割成更同质的子集,这个过程以熵和信息增益等指标为指导,以衡量不纯度的减少。
-
分析显示 AI 法官的同意率指标可能具有误导性
最近的一项分析强调了评估 AI 法官时的一个常见问题:与人类标签的总体同意率指标可能具有误导性。虽然一个法官可能显示出很高的总体同意率(例如 92%),但这个数字通常会被远离决策边界的简单案例所扭曲。实际上,法官在关键的、临界案例上的表现——那些最接近错误影响最大的阈值的案例——可能显著较低,大约为 60%。这种差异的出现是因为大多数示例都接近决策阈值,使得总体同意率统计数据在理解法官在实际门控场景中的有效性方面信息量不足。
-
作者集成四个工具以增强 Claude Agent 功能
作者详细介绍了为内部团队使用的 Claude Agent 集成的四个工具。这些工具增强了该 Agent 的能力,每个添加的工具都因其对 Agent 功能的特定贡献而得到证明。该 Agent 是使用 Claude Code 和 Claude Agent SDK 构建的。
-
树莓派成为原生边缘计算机器学习气象站
一个项目已将树莓派 Zero 2 W 和 Sense HAT V2 改造成了一个独立的、原生边缘计算的机器学习气象站。该设置在没有云连接或重型机器学习框架的情况下运行,利用纯 NumPy 实现进行高级统计建模,包括卡尔曼滤波和共形预测。该系统持续更新其本地大气模型,生成校准的不确定性区间,并在 Sense HAT 的 LED 矩阵上显示动画预测,整个项目是开源的。
-
在机器学习模型中分箱连续变量会丢失大量信号
在机器学习模型中分箱连续变量,例如将年龄划分为离散类别,会显著降低模型的预测能力。研究表明,即使是简单的中位数分割也会丢弃数据集中约36%的信息。这种做法会在存在平滑关系的地方产生人为的不连续性,可能导致模型性能不佳和可利用的决策边界。
-
Scikit-learn 1.9.0 通过新的 Narwhals 依赖项增强 DataFrame 互操作性
Scikit-learn 1.9.0 版本于 2026 年 6 月 2 日发布,引入了超出典型更新的重大变化。一项关键发展是增加了 Narwhals 作为依赖项,旨在增强跨各种 DataFrame 库的互操作性。此版本还将支持扩展到 Python 3.11 至 3.14,提供更现代的运行时环境。建议开发人员仔细检查其机器学习管道的兼容性,因为此更新会影响 NumPy、SciPy 和 joblib 等工具的更广泛生态系统。
-
开发者开源确定性钩针图表引擎
一位开发者开源了一个名为 `crochetpatterngen-engine` 的确定性图像到钩针图表引擎。这个 Python 库和命令行工具可以处理照片并生成精确的、可用于编织的图表,包括确切的纱线用量,确保了与 AI 图像生成器不同的稳定性。该引擎考虑了钩针针脚的物理纵横比,防止最终织物变形。此外,它还包含一个 MCP 服务器,允许 AI 代理使用这些确定性工具来执行诸如生成图表或估算纱线需求等任务。
-
RAG架构详解:从文档到答案
本文详细介绍了检索增强生成(RAG)系统的架构,解释了其核心组件及其职责。它概述了一个包含文档解析、分块、嵌入、向量存储、语义搜索和响应生成的管道,强调了将这些阶段分开进行独立测试和可靠运行的重要性。作者以其内部知识助手Guidely为例,说明RAG系统如何从文档中检索相关信息来构建答案,并附带引用。
-
Reflex XY Python 库增强交互式数据可视化
Reflex XY Python 库提供了创建交互式和可扩展数据可视化的高级功能。它支持组合模型以合并多个图表元素,通过自动切换到基于密度的渲染来处理大型数据集,并通过流式传输实现动态更新。该库还允许将浏览器交互连接回 Python,并提供自定义和扩展视觉组件的选项,可视化结果可导出为独立的 HTML、SVG 或 PNG 文件。
-
特征工程:转换数据以提升AI模型性能
特征工程是将输入数据转换为机器学习模型可以更好地利用的格式的过程,仍然是一种非常有效的技术。通过改变数据的坐标系,特征工程可以使某些模型类别(例如线性模型或决策树)能够解决原本难以解决的问题。经典的例子包括为线性模型创建交互项(如乘法),或使用正弦和余弦变换对周期性时间特征进行编码以准确表示圆形关系。按组聚合数据(例如计算每个实体的计数或均值)以及仔细处理分类编码(如目标编码)也是提高模型性能的强大方法。
-
AI 可复现性需要的不只是数据;模型、运行时和权限是关键
仅复制数据不足以完全复现 AI 模型运行。密封的数据状态确认了输入,但要完全复现,还需要原始执行时使用的特定模型版本、运行时环境、必要工具以及确切的权限。这种全面的方法确保了生产 AI 系统的真正可复现性。
-
新框架可自动执行算法的统计检验
研究人员开发了AutoSI,一个新颖的框架,旨在自动化为算法选择的假设生成统计上有效的p值。这种方法消除了手动推导选择事件的需要,而这以前将精确选择性推断(SI)的应用限制在一类狭窄的算法中。AutoSI可以处理通过数据有理函数表示的算法,将SI的范围扩展到线性或二次不等式之外。实验表明,AutoSI在保持高统计功效的同时有效地控制了I类错误率。
-
神经网络:令牌ID如何变成矩阵乘法
本文解释了自然语言处理中使用的神经网络的基本计算。它详细说明了单词如何首先被转换为数字令牌ID,然后由网络层进行处理。每一层都执行带有学习权重的矩阵乘法,然后进行ReLU等非线性激活函数,将输入向量转换为新的表示。文章强调了GPU如何加速这些可并行化的矩阵运算,并将其与循环神经网络(RNN)的顺序计算进行对比,解释了Transformer为何能更有效地扩展。
-
Fortran 转译器 FGPT 将遗留代码桥接到 JAX 和 NumPy
研究人员开发了 FGPT,这是一种新颖的转译器,旨在将遗留的 Fortran 代码转换为现代 Python 框架,如 JAX 和 NumPy。该工具旨在弥合不熟悉 Fortran 但需要利用其高性能计算能力的科学家的专业知识差距。FGPT 将 Fortran 转换为 GPU 适配或自动微分版本,为大规模科学应用保留语义保真度和数值精度。
-
统一的 RLVR 算法 GRPO、Dr. GRPO 和 DAPO 详解
伊利诺伊大学厄巴纳-香槟分校 Bay 和 Yearick 的一篇新论文揭示,GRPO、Dr. GRPO 和 DAPO 在单一算法下得到统一,仅在处理组内奖励标准差(σ)方面有所不同。该论文提供了精确的公式来阐明每种变体何时最有效。GRPO 除以 σ 会放大简单和困难问题的梯度,而 Dr. GRPO 使用 σ 进行自然难度加权。DAPO 通过丢弃 σ 为零的批次来优化计算,这在困难问题中很常见。