Data Version Control
PulseAugur coverage of Data Version Control — every cluster mentioning Data Version Control across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
MLOps 指南详述 DVC 与 MinIO、CI/CD 和 Kubernetes 的集成
本系列分为两部分,详细介绍了如何大规模实施数据版本控制 (DVC),重点关注与 MinIO 的对象存储集成、用于自动化的 CI/CD 流水线以及用于编排的 Kubernetes。文章指导用户设置一个健壮的 MLOps 工作流程,确保生产模型的数据可追溯性和可复现性。
-
MLOps:掌握 DVC-Helper 的数据版本控制以实现可复现的机器学习
本文讨论了 MLOps 中数据版本控制 (DVC) 对于确保机器学习项目可复现性的重要性。它强调了在机器学习管道开发过程中面临的常见挑战,并介绍了 DVC-Helper 作为一种简化数据版本管理过程的工具。
-
构建用于员工流失预测的生产级MLOps平台
本文详细介绍了构建一个用于预测员工流失的生产级MLOps平台的过程。内容涵盖了从原始数据摄取到实时预测API部署的端到端流程。讨论的关键技术和方法包括Airflow、Feast、MLflow、DVC、FastAPI、数据管道、模型训练、部署、监控、版本控制、CI/CD、Kubernetes和Docker。
-
机器学习和数据湖的数据版本控制工具评测
本文对机器学习和数据湖的数据版本控制工具进行了实用性概述。文章考察了 Dolt、DVC、Delta Lake、Iceberg、Hudi 和 lakeFS 等平台,深入探讨了它们有效管理和分析数据的能力。本次评测旨在帮助用户了解在 MLOps 工作流中进行可靠数据版本控制的可用选项。
-
面向 MLOps 的数据版本控制 (DVC) 详解
数据版本控制 (DVC) 是一个旨在跟踪机器学习数据和模型的工具,它补充了 Git 的代码跟踪功能。本文提供了使用 DVC 的实用指南,并通过一个葡萄酒质量模型演示了其应用。教程涵盖了使用云远程存储设置 DVC,并将其集成到持续集成 (CI) 管道中。
-
MLOps挑战:使用远程存储构建DVC管道
作者详细介绍了构建DVC ML管道的经验,其中包含了远程存储和实验跟踪。这项任务是更大规模的“100天MLOps挑战”的一部分,旨在提高机器学习运维的实践技能。
-
每日MLOps、DevOps和AWS云挑战记录
该集群涵盖了个人在学习MLOps、DevOps和云(AWS)过程中遇到的每日挑战。条目详细介绍了具体任务,例如为MLOps运行DVC实验、为DevOps安装PostgreSQL以及在AWS中创建IAM组和用户以提高云熟练度。这些帖子记录了在这些领域中技能的进展和实际应用。
-
数据版本控制增强机器学习流水线可复现性
本文讨论了机器学习和数据科学中可复现性的重要性。文章重点介绍了数据版本控制 (DVC) 作为一种工具,可以帮助管理和跟踪机器学习流水线中的指标,是对 Git 版本控制功能的补充。
-
Kubernetes ML 流水线:使用 FastAPI 和 MLflow 进行模型推理
本系列文章详细介绍了在 Kubernetes 上创建机器学习流水线。第三部分着重于使用 FastAPI 和 MLflow 部署模型推理服务,该服务建立在第二部分中已建立的 CI 驱动的模型训练之上。前一部分涵盖了使用 Jenkins、MLflow 和 DVC 训练模型,为后续的部署阶段奠定了基础。
-
Kubernetes 和 DVC 构成机器学习流水线基础
本文介绍了一个关于使用 Kubernetes 和 DVC 构建机器学习流水线的系列文章的第一部分。它侧重于为这些流水线建立本地 Kubernetes 基础。该系列旨在指导读者完成创建健壮的 MLOps 工作流程的过程。
-
MLOps指南解释了在新的克隆副本上恢复DVC数据
本文详细介绍了如何在新的克隆仓库中使用数据版本控制(DVC)工具恢复数据。它为使用DVC进行数据管理的机器学习项目的开发人员提供了实用的指南。该帖子是“100天MLOps”挑战的一部分。
-
DVC在MLOps挑战中配置为S3兼容的远程存储
本文详细介绍了如何配置DVC(Data Version Control)使用S3兼容的远程存储。它为寻求高效管理大型数据集和模型的MLOps从业者提供了实用指南。该帖子是专注于MLOps实践的100天挑战的一部分。
-
MLOps挑战详解Git到DVC数据迁移
本系列详细介绍了在100天MLOps挑战中将大型数据集从Git迁移到数据版本控制(DVC)的过程。文章重点介绍了在机器学习项目中使用DVC进行数据版本控制的实际步骤和好处。目标是简化数据管理并提高MLOps工作流的可重复性。
-
机器学习实践者无需专用工具即可进行数据集版本控制
本文提出了一种实用的、无需工具的数据集版本控制方法,用于机器学习以确保可复现性。文章认为,关键在于维护管道和训练过程之间一致的数据契约,而不是一开始就依赖 DVC 或 MLflow 等专用工具。该方法涉及有纪律的自动化和元数据跟踪,例如 lineage 和转换细节,然后再采用更复杂的解决方案。
-
呼吁南非大学为生成式AI的采用做好准备
生成式AI已在南非大学中出现,学生和部分教职员工在使用它,但缺乏明确的机构政策。决策者必须为AI的采用做好准备,而不是仅仅做出反应,要关注机构相关性、学术信誉和受信责任。真正的准备涉及有意识地回答关于责任、数据风险、用户准备度、成功衡量和合规性的关键问题,而不是仅仅优先考虑速度。
-
动态藤蔓协方差检测数据中时变的高阶交互作用
研究人员引入了动态藤蔓协方差(DVC),一个旨在检测和量化多元系统中时变高阶交互作用的新框架。与关注相关性的传统方法不同,DVC专门处理尾部行为、不对称性和条件结构的变化。该框架包括一个诊断工具,将完整的藤蔓得分与截断的藤蔓得分进行对比,区分成对依赖和条件依赖。DVC已在受控基准测试中证明了其识别复杂时间变化的能力,并已应用于分析神经数据,揭示了可复现的跨区域依赖信号。
-
AWS 和 DVC 集成以实现端到端机器学习模型数据沿袭跟踪
一项新解决方案集成了 DVC 和 Amazon SageMaker MLflow 应用,为机器学习模型提供端到端数据沿袭跟踪。这解决了将模型追溯到其确切训练数据和代码的挑战,这对于受监管的行业至关重要。这些工具的结合创建了一个从已部署模型到其特定数据集版本和训练实验的可追溯链。