Jupyter Notebooks
PulseAugur coverage of Jupyter Notebooks — every cluster mentioning Jupyter Notebooks across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI代理可以通过基于意义的缓存实现更高的效率,而不仅仅是基于文本
Prompt缓存虽然可以降低输入令牌成本,但并不能阻止AI模型从头开始重新处理任务和生成响应。真正的效率提升来自于基于语义意义而非精确文本的缓存。这种方法可以近乎即时地检索先前生成的答案或推理路径,从而显著减少计算工作和成本。文章介绍了Strands Agents,它通过允许缓存直接集成到代理的生命周期中(通过钩子和内存组件),使开发人员能够绕过对重复或相似查询的完整模型执行。
-
新的因果基础模型将预训练网络应用于因果推断
一篇新论文介绍了因果基础模型(CFM)的概念,旨在将基础模型范式应用于因果推断。CFM 是预训练的神经网络,能够通过上下文学习(in-context learning)估计新数据集上的因果量,例如平均处理效应,而无需更新模型。该方法试图通过提供一种更通用、更适应性强的方法来简化传统的、定制化的因果推断流程。
-
Databricks 项目组成部分详解:Spark、Delta Lake、MLflow
本文分解了构成 Databricks 项目的核心组件和技术。文章强调了该平台的集成特性,重点介绍了 Apache Spark、Delta Lake 和 MLflow 等工具。解释涵盖了各种编程语言和开发环境,如 Python、R、Scala 和 Jupyter Notebooks,所有这些都在云基础设施中。
-
Git 对 AI 编码工作流至关重要,尤其是在团队协作方面
本文强调了 Git 在管理 AI 编码工作流中的关键作用,尤其是在团队协作方面。文章指出,Git 有助于 AI 项目的版本控制、协作和可复现性,而 AI 项目通常涉及复杂的代码、数据和模型。文章认为,在 AI 开发生命周期中,健全的 Git 实践对于维护项目完整性和实现高效团队合作至关重要。
-
MLOps指南详述模型从笔记本迁移到生产系统
两篇Medium文章详细介绍了将机器学习模型从Jupyter Notebook等开发环境迁移到生产就绪系统的过程。文章涵盖了MLOps的关键工具和实践,包括Pandas和scikit-learn等Python库、使用Docker和Kubernetes进行容器化,以及AWS、Google Cloud Platform和Azure等云平台。文章强调将分析代码重构为模块化系统,并集成MLflow等工具以实现稳健部署。
-
AI 可复现性需要的不只是数据;模型、运行时和权限是关键
仅复制数据不足以完全复现 AI 模型运行。密封的数据状态确认了输入,但要完全复现,还需要原始执行时使用的特定模型版本、运行时环境、必要工具以及确切的权限。这种全面的方法确保了生产 AI 系统的真正可复现性。
-
MLOps之旅:在华为云上训练和部署模型
本文详细介绍了在华为云上训练和部署机器学习模型的流程,源于一次个人数据科学训练营的经验。文章强调了从Jupyter Notebook等本地开发环境向基于云的MLOps实践的转变。作者将华为云的功能与其他主要云服务提供商(如Amazon SageMaker、Google Cloud AI Platform和Microsoft Azure Machine Learning)进行了比较,讨论了Tensorflow和PyTorch等框架,以及…
-
LangGraph 实现超越基本循环的状态化多代理 AI 工作流
开发人员正在使用 LangGraph 探索先进的多代理 AI 工作流,LangGraph 是一个解决了简单 AI 代理实现中局限性的框架。虽然 Python 和 Jupyter Notebook 常用于基本的 AI 任务,但企业应用程序,尤其是在金融领域,需要更强大的解决方案。LangGraph 通过诸如人工干预检查点、动态路由和持久状态等功能实现状态化工作流,这些功能对于生产就绪的 AI 代理至关重要。这种方法有助于克服在复杂的、多…
-
构建生产级 LLM 评估流水线:从感觉走向指标 · 跟踪 8 个来源
这一系列文章详细介绍了为大型语言模型(LLM)构建生产级评估流水线的过程,超越了主观的“感觉检查”,转而实施自动化指标。作者强调了领域特定裁判、CI/CD 集成的速度、回归检测以及健壮的黄金数据集管理的需求。他们提出了一种涉及测试用例、待测 LLM、裁判集合和用于回归检测的指标的架构,并提供了使用 GPT-4o mini 等模型构建自定义 LLM 裁判的示例。
-
Plainbook 系统使用自然语言使数据科学更易于访问
一个名为 Plainbook 的新系统已被开发出来,它通过围绕自然语言而非代码来构建笔记本,从而使数据科学更易于访问。这种方法旨在使对数据分析感兴趣但缺乏编码专业知识的科学家受益。Plainbook 优先使用自然语言描述,并根据这些描述自动生成代码,同时强制执行线性执行顺序以简化理解和验证。
-
银行风险情报引擎依赖MLOps和数据分析工具
本文详细介绍了现代银行中风险数据分析专业人员的日常工作,重点关注MLOps管道。该角色涉及使用Python、SQL和Jupyter Notebook等工具来管理和分析数据,在AWS SageMaker等平台上部署机器学习模型,并通过Git、Docker和Kubernetes等工具的CI/CD实践确保顺畅集成。叙述强调了这些技术在构建和维护银行风险情报引擎中的实际应用。
-
新的 JupOtter 系统检测 Jupyter Notebooks 中的错误
研究人员开发了 JupOtter,一个专门用于检测 Jupyter Notebooks 中错误的系统。该系统采用了一种独特的标记化方法,该方法保留了 Notebook 的单元格结构,并采用单元格级别的错误预测技术。JupOtter 在 OtterDataset 上进行了训练,OtterDataset 是一个新创建的数据集,包含 21,000 多个已标注单元格级别错误的 Notebook,并且在某些评估数据集上,其性能优于传统的静态分析…
-
Scikit-learn推出由核心开发者制作的官方在线公开课
由INRIA的核心贡献者开发的官方scikit-learn在线公开课现已上线。这门免费的实践课程使用Jupyter Notebook来教授预测建模,内容涵盖从预处理到模型评估的各个方面。它旨在培养对机器学习的深刻直觉,而不仅仅是代码执行。
-
MergeNB 为 VS Code 用户提供新的 Jupyter Notebook 合并工具
一款名为 MergeNB 的新 VS Code 扩展已被开发出来,用于解决协作研究环境中合并 Jupyter Notebook 时遇到的问题。开发者创建 MergeNB 是为了改进现有工具(如 nbdime)的不足之处,他们发现 nbdime 存在 bug。该项目是开源的,旨在成为管理 Notebook 冲突的用户友好解决方案。
-
Patterns 推出类似 Heroku 的 AI 应用开发平台
Patterns 是一家由前数据科学家和工程师创立的初创公司,它推出了一个旨在简化数据和 AI 应用开发与部署的平台。该服务旨在通过抽象化计算管理、编排和可视化等复杂性来提供 10 倍的生产力提升,其功能类似于 Heroku,但专门针对 AI 应用。它面向对 Jupyter notebooks 和 Airflow 等现有工具感到沮丧的数据工程师和科学家,提供了一个具有各种节点抽象的反应式图形架构,以简化端到端数据管道和自动化的创建。