TVM
PulseAugur coverage of TVM — every cluster mentioning TVM across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架 FBLayout 提升移动 LLM 微调效率
研究人员开发了 FBLayout,一个旨在优化内存布局以在移动 GPU 上高效微调大型语言模型的新框架。该方法解决了阻碍设备端 AI 个性化的内存限制和布局转换效率低下的问题。FBLayout 引入了统一的 R-Tile 布局、基于块的索引转换和由激活引导的布局选择,以最大限度地减少数据移动和内存占用。在各种 Transformer 模型和移动 GPU 上的评估表明,与现有框架相比,速度显著提升,从而实现了实用的设备端微调。
-
InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构
研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。
-
通过 Vulkan 在 GPU 上运行神经网络:库、编译器或自定义引擎
本文概述了使用 Vulkan API 在 GPU 上运行已训练神经网络的三种方法。它建议集成现有的库,如 TensorFlow Lite 或 ONNX Runtime,通过 ML 编译器(如 IREE 或 TVM)编译模型,或使用计算着色器开发自定义推理引擎以实现深度 Vulkan 集成。
-
AI代理自动化数据准备,而新的Python ML编译器加速LLM压缩
研究人员开发了一个仅用5000行Python编写的新开源机器学习编译器栈。该栈通过将大型语言模型降低到具有六个中间表示的CUDA,提供了前所未有的透明度。它旨在易于修改且针对CUDA进行了优化,与PyTorch或TVM等更复杂的系统形成对比。此外,AI代理因其自动化探索性数据分析和数据准备任务的潜力而受到关注,有望为数据科学家节省大量时间。