Tpc H
PulseAugur coverage of Tpc H — every cluster mentioning Tpc H across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的 CATune 框架使用 LLM 提取的约束来优化 DBMS 配置
研究人员开发了 CATune,一个用于优化数据库管理系统 (DBMS) 配置的新框架。与先前将配置空间视为无约束的方法不同,CATune 显式地对配置旋钮之间的确定性排序约束进行建模。这种方法允许在有效子空间内进行优化,避免了昂贵的无效配置采样。该框架还包括一个使用 LLM 从文档中提取这些约束的管道,提高了鲁棒性和系统稳定性。在 PostgreSQL 和 MySQL 上的实验表明,在样本效率和调优质量方面取得了显著改进,CATune…
-
新基准测试LLM在GPU数据库查询优化方面的能力
研究人员开发了DataKernelBench,这是一个旨在评估大型语言模型(LLM)针对GPU优化数据库查询能力的新基准。与专注于机器学习算子的现有基准不同,DataKernelBench解决了数据密集型数据库操作的独特挑战。该基准将SQL查询转换为PyTorch TorchPlan程序,使LLM能够使用CUDA或Triton优化特定的代码片段或整个查询。使用NVIDIA H100 GPU在TPC-H数据集上进行的初步测试表明,LLM…
-
新的 SAL 中间件通过将 LLM 关联到实时模式数据,提高了 Oracle NL2SQL 的准确性
研究人员开发了 Schema-Aware Localisation (SAL),这是一种用于 Oracle NL2SQL 系统的新型中间件,可在不重新训练语言模型的情况下提高 SQL 执行的准确性。SAL 通过查询 USER_TAB_COLUMNS 来创建实时模式图,然后利用该图在 LLM 提示中提供相关的表上下文,从而与 Oracle 数据库集成。此外,SAL 采用幻觉指数 (Hidx) 来验证生成的 SQL 是否与实时目录匹配,自…
-
Snowflake MLOps 系列:特征存储解决数据版本控制挑战
本文讨论了特征存储在 MLOps 中的重要性,解释了它如何解决模型注册表在管理和版本化用于训练和推理的数据集方面的局限性。文章强调了特征工程的迭代性质以及对特征集进行稳健跟踪的必要性,并将其与模型和超参数的管理进行对比。文章使用 TPC-H 数据和 XGBoost 来演示,即使算法保持不变,不同的特征集也会对模型性能产生重大影响。
-
大型语言模型绕过数据库驱动程序直接读取存储文件
一种名为 Jailbreak 的新方法使用大型语言模型 (LLM) 来绕过传统的数据库驱动程序并直接读取存储文件。通过摄取数据库源代码和文档,LLM 可以再生专门的读取器,将数据物化到内存中的列式缓冲区。该方法已显示出显著的性能改进,在 PostgreSQL 和 MySQL 等系统的分析吞吐量方面实现了高达 27 倍的加速,并生成了与 DuckDB、Apache Spark 和 cuDF 等引擎兼容的 Apache Arrow 缓冲区。
-
OceanBase 发布统一多模态数据 AI 数据库
OceanBase 发布了新的集成 AI 的数据库,旨在统一数据湖和数据库功能。这种新架构旨在单一系统中管理结构化、非结构化和向量数据,使 AI 代理能够访问全面的业务上下文。该产品套件包括 Lakebase、DataStudio 和 DataPilot,据报道已在蚂蚁集团的 Afu 和灵光等 AI 场景中得到验证。
-
新AI框架优化计算系统的DAG调度
研究人员开发了WeCAN,一个新颖的强化学习框架,旨在优化大规模计算系统中定向无环图(DAG)的调度。该框架解决了生成过程带来的任务池兼容性和最优性差距等挑战。WeCAN采用两阶段单次设计,生成任务池分数和全局参数,然后进行调度构建映射。在TPC-H查询DAG和ML编译器计算图上的实验表明,WeCAN在完成时间方面优于现有基线,同时保持了具有竞争力的推理时间。
-
MLSkip 通过轻量级元数据改进数据库过滤
研究人员开发了 MLSkip,一种用于改进数据库中机器学习过滤数据跳过的创新技术。传统方法对于过滤谓词中昂贵的黑盒机器学习模型无效。MLSkip 利用 Parquet 的 min-max 元数据和神经网络验证来修剪不符合条件的数据组,有效性高达 38.31%。该方法在 DuckDB 中比 PyTorch 实现了 1.07 倍的端到端加速。
-
AI 代理在 PostgreSQL 性能调优方面优于文档
研究人员开发了一种名为 PerfEvolve 的新方法,该方法使用 AI 代理来调优 PostgreSQL 性能,超越了静态文档。这种方法使代理具备了验证版本、分析工作负载和同时优化多个参数的技能。在使用 TPC-C 和 TPC-H 基准测试的测试中,PerfEvolve 证明其性能比现有的文档驱动调优方法提高了 35.2%。