SciPy
PulseAugur coverage of SciPy — every cluster mentioning SciPy across labs, papers, and developer communities, ranked by signal.
-
新的基准测试使用真实代码优化测试 LLM
研究人员推出了 SWE-fficiency,这是一个旨在评估语言模型在真实软件存储库上性能优化能力的新基准。该基准包含 498 个任务,涵盖 NumPy 和 Pandas 等九个流行的数据科学、机器学习和 HPC 存储库。它挑战代理分析代码、识别性能瓶颈并提出能够匹配或超越专家加速效果但又能通过所有单元测试的补丁。初步评估显示,当前最先进的代理表现明显不佳,由于在定位、跨函数推理和保持代码正确性方面存在困难,其加速效果仅为专家的 0.…
-
LLM 评估指标需要置信区间来区分信号与噪声
评估大型语言模型 (LLM) 需要理解性能指标中固有的不确定性。单一分数,例如 84.2% 的准确率,可能具有误导性,因为它没有考虑到抽样误差。通过使用 bootstrap 置信区间,开发人员可以将点估计转换为一个范围,揭示模型之间观察到的差异是否具有统计学意义,还是仅仅是噪声。这种方法,特别是用于模型比较的配对 bootstrap,有助于确保改进是真实的,而不是特定评估数据集的结果。
-
NVIDIA Canary-1B-v2 教程:ASR、翻译和字幕生成
本教程演示了如何利用 NVIDIA 的 Canary-1B-v2 模型进行高级音频处理任务,包括自动语音识别 (ASR)、翻译和字幕生成。该指南涵盖了使用 NeMo、NumPy 和 SciPy 等依赖项设置必要的 Python 环境,然后加载 Canary 模型以在 GPU 上进行高效推理。它详细介绍了准备音频文件、执行多语言 ASR、翻译语音、生成时间戳以及导出 SRT 格式字幕,为各种音频应用提供了全面的流程。
-
新研究探索用于符号回归的遗传编程 · 已追踪 2 个来源
两篇最新的 arXiv 论文探讨了用于符号回归 (SR) 的遗传编程 (GP)。一项研究“Evaluation of Population Initialization Methods for Genetic Programming-based Symbolic Regression”发现,包括使用优化解决方案作为种子的方法在内的不同随机初始化方法,在 GP-based SR 的准确性或模型复杂度方面没有显著差异。另一篇论文“Evol…
-
TimeCopilot 教程展示了使用 Foundation Models 的端到端预测
本教程演示了如何使用 TimeCopilot 构建端到端的预测管道,TimeCopilot 是一个集成了各种预测模型的工具。该过程包括准备一个包含真实航空公司乘客数据和包含异常值的合成序列的数据集。然后,它评估了一系列统计模型,包括 Prophet 和 Chronos,以及可选的基于 GPU 的模型,如 TimesFM,以确定最佳性能模型。工作流程包括生成概率预测、可视化趋势、检测异常观测值以及利用 LLM 代理进行模型选择和解释。
-
新框架提炼基础模型用于专业时间序列预测
研究人员开发了一个名为 Guard 的新颖框架,用于将大型通用基础模型(FM)的知识提炼成轻量级、专业的时序预测器。该方法解决了 FM 在科学领域应用面临的挑战,这些领域中分布不匹配和高计算成本是重大障碍。Guard 使用实例级决策过程和上下文路由器来选择最相关的教师 FM,并使用不确定性门控温度机制来控制提炼强度,从而实现适合资源受限边缘部署的高精度预测。此外,一个教程演示了如何使用 TimeCopilot 构建端到端的预测管道,该…
-
PyTorch 获得可微分稀疏线性代数库
研究人员开发了 torch-sla,一个开源的 Python 库,旨在为 PyTorch 提供可微分稀疏线性代数功能。该库弥补了 PyTorch 现有功能中的不足,目前仅提供低级内核或仅限 CPU、不可微分的求解器。Torch-sla 支持跨多个后端(包括 CPU 和 GPU 选项)的各种求解器类型的统一 API,并支持分布式执行以增强可扩展性。