SciPy
PulseAugur coverage of SciPy — every cluster mentioning SciPy across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
国产开源模型ZDTaichu5.0-9B引领空间AI
一款新的开源多模态大模型ZDTaichu5.0-9B已发布,在空间具身和通用智能方面展现出领先能力。该模型在九项国际空间理解基准测试中取得了顶尖性能,在需要复杂空间判断和行动规划的任务中表现出色。尽管其参数量相对较小(90亿),ZDTaichu5.0-9B在文本理解、OCR、数学推理和编码方面也保持了强劲性能,使其在该类别中跻身全球顶尖模型之列。
-
使用标准工具实现的RFF模型的白盒后门攻击
研究人员已经实现了对使用随机傅里叶特征(RFF)的机器学习模型的理论白盒后门攻击。此实现使用NumPy和SciPy等标准科学计算工具构建,测试了此类攻击的实际可行性,这些攻击即使在拥有模型权重完全访问权限的情况下也旨在不可检测。研究发现,在各种稀疏度比率下,后门模型和干净模型之间没有可检测的差异,这有助于理解这些复杂的加密威胁的可实现性。
-
YuE2-3B 音频模型通过新的分词和微调工具得到增强
为 YuE2-3B 音频生成模型发布了一套新工具,使用户能够对自己的录音进行分词,并针对特定艺术家微调模型。此次发布包括一个音频到语义分词编码器和一个 NAR 分支 LoRA,可用于生成新歌曲或翻唱。这些工具设计用于 24GB GPU,并需要特定的 Python 库和数据集。
-
新的 whitetree 库增强了 SciPy k-d 树以处理流式数据
一个名为 whitetree 的新库已被开发出来,用于高效处理流式传感器数据上的最近邻搜索。它利用多个 SciPy k-d 树来管理插入和删除,而无需完全重建,在某些操作上比 scikit-learn 的 BallTree 和 FAISS 等现有库实现了显著的加速。该库仅基于 NumPy 和 SciPy 构建,支持多读单写线程,并提供与静态 k-d 树匹配的精确结果。
-
TorchMorph 为形态学变换带来 GPU 加速
TorchMorph 是一个新的 PyTorch 扩展,它将形态学变换带到 GPU 上,解决了现有仅 CPU 实现(如 SciPy)的局限性。它提供了 22 个 CUDA 加速算子,用于各种形态学类型和距离变换,支持多达八个空间维度。这带来了显著的性能提升,TorchMorph 在灰度形态学方面的吞吐量比 SciPy 高出 1100 倍,在距离变换方面高出 350 倍,同时保持了高精度。
-
TorchMorph 将 GPU 加速的形态学变换引入 PyTorch
TorchMorph 是一个新的 PyTorch 扩展,提供 GPU 加速的形态学和距离变换算子。它提供了 22 个算子,包括二值和灰度形态学,以及各种距离变换,这些算子都实现了为融合的 CUDA 内核。该库的设计旨在模仿 SciPy API,可以轻松集成到现有流程中,并提供比基于 CPU 的实现显著的速度提升。
-
Python 教程复现 LabPlot 数据分析工作流
本教程演示了如何使用受 LabPlot 启发的工作流在 Python 中进行科学数据分析。它涵盖了信号处理、峰拟合和可视化等基本数据处理技术,并利用了 NumPy、Pandas、Matplotlib 和 SciPy 等库。该工作流设计为可重用,并可扩展到批量处理以分析多个数据集,如在光谱学示例中所示。
-
Claude Code 通过聊天代理提供基于脚本的健康数据分析
Claude Code 是一款基于终端的人工智能代理,通过生成可执行脚本和可视化,为健康数据分析提供了优于纯聊天人工智能的独特优势。与提供数值输出的标准聊天代理不同,Claude Code 可以创建可重用的脚本来处理数据、生成图表,并自动使用新信息重新运行。这种方法允许用户直接在自己的机器上执行复杂分析,例如将心率变异性与睡眠时长相关联,并将脚本和结果本地保存,以实现透明度和进一步修改。
-
Scikit-learn 1.9.0 通过新的 Narwhals 依赖项增强 DataFrame 互操作性
Scikit-learn 1.9.0 版本于 2026 年 6 月 2 日发布,引入了超出典型更新的重大变化。一项关键发展是增加了 Narwhals 作为依赖项,旨在增强跨各种 DataFrame 库的互操作性。此版本还将支持扩展到 Python 3.11 至 3.14,提供更现代的运行时环境。建议开发人员仔细检查其机器学习管道的兼容性,因为此更新会影响 NumPy、SciPy 和 joblib 等工具的更广泛生态系统。
-
新的基准测试使用真实代码优化测试 LLM
研究人员推出了 SWE-fficiency,这是一个旨在评估语言模型在真实软件存储库上性能优化能力的新基准。该基准包含 498 个任务,涵盖 NumPy 和 Pandas 等九个流行的数据科学、机器学习和 HPC 存储库。它挑战代理分析代码、识别性能瓶颈并提出能够匹配或超越专家加速效果但又能通过所有单元测试的补丁。初步评估显示,当前最先进的代理表现明显不佳,由于在定位、跨函数推理和保持代码正确性方面存在困难,其加速效果仅为专家的 0.…
-
LLM 评估指标需要置信区间来区分信号与噪声
评估大型语言模型 (LLM) 需要理解性能指标中固有的不确定性。单一分数,例如 84.2% 的准确率,可能具有误导性,因为它没有考虑到抽样误差。通过使用 bootstrap 置信区间,开发人员可以将点估计转换为一个范围,揭示模型之间观察到的差异是否具有统计学意义,还是仅仅是噪声。这种方法,特别是用于模型比较的配对 bootstrap,有助于确保改进是真实的,而不是特定评估数据集的结果。
-
NVIDIA Canary-1B-v2 教程:ASR、翻译和字幕生成
本教程演示了如何利用 NVIDIA 的 Canary-1B-v2 模型进行高级音频处理任务,包括自动语音识别 (ASR)、翻译和字幕生成。该指南涵盖了使用 NeMo、NumPy 和 SciPy 等依赖项设置必要的 Python 环境,然后加载 Canary 模型以在 GPU 上进行高效推理。它详细介绍了准备音频文件、执行多语言 ASR、翻译语音、生成时间戳以及导出 SRT 格式字幕,为各种音频应用提供了全面的流程。
-
新研究探索用于符号回归的遗传编程 · 已追踪 2 个来源
两篇最新的 arXiv 论文探讨了用于符号回归 (SR) 的遗传编程 (GP)。一项研究“Evaluation of Population Initialization Methods for Genetic Programming-based Symbolic Regression”发现,包括使用优化解决方案作为种子的方法在内的不同随机初始化方法,在 GP-based SR 的准确性或模型复杂度方面没有显著差异。另一篇论文“Evol…
-
TimeCopilot 教程展示了使用 Foundation Models 的端到端预测
本教程演示了如何使用 TimeCopilot 构建端到端的预测管道,TimeCopilot 是一个集成了各种预测模型的工具。该过程包括准备一个包含真实航空公司乘客数据和包含异常值的合成序列的数据集。然后,它评估了一系列统计模型,包括 Prophet 和 Chronos,以及可选的基于 GPU 的模型,如 TimesFM,以确定最佳性能模型。工作流程包括生成概率预测、可视化趋势、检测异常观测值以及利用 LLM 代理进行模型选择和解释。
-
新框架提炼基础模型用于专业时间序列预测
研究人员开发了一个名为 Guard 的新颖框架,用于将大型通用基础模型(FM)的知识提炼成轻量级、专业的时序预测器。该方法解决了 FM 在科学领域应用面临的挑战,这些领域中分布不匹配和高计算成本是重大障碍。Guard 使用实例级决策过程和上下文路由器来选择最相关的教师 FM,并使用不确定性门控温度机制来控制提炼强度,从而实现适合资源受限边缘部署的高精度预测。此外,一个教程演示了如何使用 TimeCopilot 构建端到端的预测管道,该…
-
PyTorch 获得可微分稀疏线性代数库
研究人员开发了 torch-sla,一个开源的 Python 库,旨在为 PyTorch 提供可微分稀疏线性代数功能。该库弥补了 PyTorch 现有功能中的不足,目前仅提供低级内核或仅限 CPU、不可微分的求解器。Torch-sla 支持跨多个后端(包括 CPU 和 GPU 选项)的各种求解器类型的统一 API,并支持分布式执行以增强可扩展性。
-
OpenAI 在科学和安全领域推进 AI 代理;Google DeepMind 资助多智能体研究
OpenAI 正通过多项举措推进科学计算和 AI 安全。该公司发布了一个新的基准 GeneBench-Pro,以评估 AI 代理处理复杂生物数据的能力。OpenAI 还在欧洲为可信赖 AI 的共享标准制定做出贡献,并与伦敦证券交易所集团等组织合作,将 AI 整合到业务运营中。与此同时,Google DeepMind 正在向多智能体 AI 安全研究投资 1000 万美元,旨在理解和减轻与交互式 AI 系统相关的风险。