Tpc H
PulseAugur coverage of Tpc H — every cluster mentioning Tpc H across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Snowflake MLOps 系列:特征存储解决数据版本控制挑战
本文讨论了特征存储在 MLOps 中的重要性,解释了它如何解决模型注册表在管理和版本化用于训练和推理的数据集方面的局限性。文章强调了特征工程的迭代性质以及对特征集进行稳健跟踪的必要性,并将其与模型和超参数的管理进行对比。文章使用 TPC-H 数据和 XGBoost 来演示,即使算法保持不变,不同的特征集也会对模型性能产生重大影响。
-
大型语言模型绕过数据库驱动程序直接读取存储文件
一种名为 Jailbreak 的新方法使用大型语言模型 (LLM) 来绕过传统的数据库驱动程序并直接读取存储文件。通过摄取数据库源代码和文档,LLM 可以再生专门的读取器,将数据物化到内存中的列式缓冲区。该方法已显示出显著的性能改进,在 PostgreSQL 和 MySQL 等系统的分析吞吐量方面实现了高达 27 倍的加速,并生成了与 DuckDB、Apache Spark 和 cuDF 等引擎兼容的 Apache Arrow 缓冲区。
-
OceanBase 发布统一多模态数据 AI 数据库
OceanBase 发布了新的集成 AI 的数据库,旨在统一数据湖和数据库功能。这种新架构旨在单一系统中管理结构化、非结构化和向量数据,使 AI 代理能够访问全面的业务上下文。该产品套件包括 Lakebase、DataStudio 和 DataPilot,据报道已在蚂蚁集团的 Afu 和灵光等 AI 场景中得到验证。
-
新AI框架优化计算系统的DAG调度
研究人员开发了WeCAN,一个新颖的强化学习框架,旨在优化大规模计算系统中定向无环图(DAG)的调度。该框架解决了生成过程带来的任务池兼容性和最优性差距等挑战。WeCAN采用两阶段单次设计,生成任务池分数和全局参数,然后进行调度构建映射。在TPC-H查询DAG和ML编译器计算图上的实验表明,WeCAN在完成时间方面优于现有基线,同时保持了具有竞争力的推理时间。
-
MLSkip 通过轻量级元数据改进数据库过滤
研究人员开发了 MLSkip,一种用于改进数据库中机器学习过滤数据跳过的创新技术。传统方法对于过滤谓词中昂贵的黑盒机器学习模型无效。MLSkip 利用 Parquet 的 min-max 元数据和神经网络验证来修剪不符合条件的数据组,有效性高达 38.31%。该方法在 DuckDB 中比 PyTorch 实现了 1.07 倍的端到端加速。
-
AI 代理在 PostgreSQL 性能调优方面优于文档
研究人员开发了一种名为 PerfEvolve 的新方法,该方法使用 AI 代理来调优 PostgreSQL 性能,超越了静态文档。这种方法使代理具备了验证版本、分析工作负载和同时优化多个参数的技能。在使用 TPC-C 和 TPC-H 基准测试的测试中,PerfEvolve 证明其性能比现有的文档驱动调优方法提高了 35.2%。